home.social

#alerting — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #alerting, aggregated by home.social.

fetched live
  1. Как мы внедрили AIOps для контроля GPU‑утилизации и повысили её на 60%

    Привет, Хабр! На связи Даниил Понизов и Роман Лазовский , руководитель и MLOps-инженер команды ML-платформы в RWB. Мы занимаемся разработкой платформы машинного обучения, в том числе — контролируем инфраструктуру и эффективное использование ресурсов. В этой статье мы расскажем, как пришли к внедрению AIOps-подхода для работы с алертами по утилизации ресурсов, почему стандартные методы перестали работать и как автоматизация помогла нам повысить среднюю месячную утилизацию GPU на отдельных кластерах более чем на 60%.

    habr.com/ru/companies/rwb/arti

    #AIOps #mlops #gpu #inference #monitoring #observability #engineering #alertmanager #alerting #duty

  2. A practical pillar page on alerting design, routing, noise reduction, and human response across observability systems, paging tools, and chat platforms.

    #observability #alerting #prometheus #Architecture #Dev

    glukhov.org/observability/aler

  3. # От firing до postmortem: рабочее место дежурного поверх Grafana и Mattermost

    Grafana показывала, что горит, Mattermost доставлял уведомления, но после смены дежурного приходилось заново выяснять, кто занимается проблемой и когда ждать результат. Рассказываю, как мы собрали поверх них рабочее место с владельцами, ETA, общей историей, группировкой каскадных алертов, инцидентами и postmortem — без отдельной базы данных и без передачи управления состоянием LLM.

    habr.com/ru/articles/1065364/

    #alerting #grafana #mattermost #go #incident_management #support_team #postmortem #oncall

  4. Зоопарк протоколов и человеческий фактор: что внутри сложной IoT-интеграции климатического оборудования

    Мониторинг температуры в холодильном оборудовании кажется простой задачей. Особенно если речь идет всего о нескольких десятках ларей на одном производственном участке. Но когда эти лари от разных вендоров, с разными протоколами, и их еще и перемещают по цеху, задача перестает быть тривиальной. В этой статье в блоге ЛАНИТ - опыт внедрения IoT-решения без замены оборудования, с примерами ошибок и неочевидных решений. Материал будет полезен тем, кто сталкивается с промышленным мониторингом, выбирает между машинным обучением и простой логикой или пытается подружить разнородное оборудование и создать из него единую систему.

    habr.com/ru/companies/lanit/ar

    #iot #промышленный_интернет_вещей #мониторинг #alerting #MES #производство #беспроводные_датчики #инцидентменеджмент #ЛАНИТ

  5. Heartbeat-мониторинг cron-job'ов: dead-man-switch на FastAPI

    Обычный uptime-мониторинг проверяет, отвечает ли сервис на запросы. Cron-job ничего не отвечает — он запускается раз в N часов, делает работу и молча завершается. Если cron перестал запускаться (uptime daemon упал, машина в read-only mode после fsck, disk full) — обычный мониторинг этого не видит. Решение известно с 70-х — паттерн dead-man-switch (он же heartbeat). Я недавно делал heartbeat-эндпоинты для Valpero. Здесь разберу серверную часть на FastAPI + клиентский bash-pattern, и edge-кейсы которые их ломают. В конце готовый код, который можно адаптировать под свой стек.

    habr.com/ru/articles/1035624/

    #cron #heartbeat #deadmanswitch #monitoring #alerting #bash #FastAPI #Celery #devops #linux

  6. Multi-region quorum: «все регионы согласны» против «N из M»

    К-of-N или all-must-agree? Два подхода к quorum-логике в multi-region мониторинге. Я остановился на all-must-agree с consecutive-failure threshold. С Redis-схемой, кодом и разбором edge-кейсов где каждый подход ломается.

    habr.com/ru/articles/1035600/

    #мониторинг #quorum #SRE #false_positive #Redis #distributed_systems #alerting #threshold #uptime #incident_management

  7. Deep dive on Slack webhooks and apps for alerts, approvals, and workflow automation. Block Kit buttons, signature verification, Go and Python examples.

    #integration #alerting #observability #golang #python #Architecture #Dev #Go

    glukhov.org/app-architecture/i

  8. Deep dive on Discord webhooks and bots for alerts, approvals, and human-in-the-loop control. Go and Python examples, security, idempotency, and routing.

    #integration #observability #alerting #bots #python #Architecture #Dev #Go #Golang

    glukhov.org/app-architecture/i

  9. A practical pillar page on alerting design, routing, noise reduction, and human response across observability systems, paging tools, and chat platforms.

    #observability #alerting #prometheus #Architecture #Dev

    glukhov.org/observability/aler

  10. Колобок-стек: я от бабушки ушёл, или как мы написали свой сервер алертов на 16 МБ

    Pusk — self-hosted сервер алертов на 16 МБ. Один бинарник, без внешних сервисов, частично совместим с Telegram Bot API (13 методов из 80+). Типичная ситуация: несколько серверов, Zabbix собирает метрики, Python‑боты шлют алерты в Telegram. У кого‑то это веб‑проект, у кого‑то видеонаблюдение, у кого‑то живые эфиры, где 2 минут без алерта = зрители видят чёрный экран. Работало годами. А потом канал до API отвалился. Причина неважна — лимиты, блокировки, авария на стороне провайдера. Алерты встали. Нужен был свой канал доставки, который не зависит от внешних сервисов. Покатились →

    habr.com/ru/articles/1018932/

    #pusk #selfhosted #alerting #telegram_bot_api #go #sqlite #devops #monitoring #alertmanager #pwa

  11. #Gotify + #Canopsis 🎯 A vous les #Notifications ciblées et instantanées !

    Dans le cadre de la #Supervision et de l'#Hypervision, recevoir rapidement et de manière claire les bonnes informations peut faire toute la différence... Surtout en dehors des heures ouvrées ou pendant les #Astreintes.

    Découvrez comment cette intégration simple et puissante améliore votre réactivité opérationnelle dans ce nouvel article :
    canopsis.fr/gotify-canopsis-po

    #ITOps #Alerting #OpenSource #Observabilité

  12. #CanopTips 💡 Testez vos règles Canopsis en toute autonomie grâce à l'enregistrement d'événements !

    Valider des règles d’enrichissement, de corrélation ou des scénarios nécessite souvent de redemander des événements aux clients, ce qui peut être contraignant et chronophage.

    Avec l'enregistrement d’événements de #Canopsis, cette dépendance disparaît.

    🔗 canopsis.fr/enregistrement-d-e
    #SupervisionIT #Hypervision #ITOps #Observabilité #EventManagement #Alerting #OpenSource #Monitoring #SI

  13. Canopsis × #Teams 🔔 Quand l’alarme sort de la console d’#Hypervision pour arriver là où travaillent les équipes !

    Avec l’intégration #Canopsis × Teams, les alertes sont notifiées au bon moment, au bon endroit et aux bonnes personnes.

    Au-delà du message brut, la notification devient un véritable support de communication clair et synthétique.

    👉 Moins de friction, plus de réactivité et une #Collaboration réellement efficace !

    canopsis.fr/microsoft-teams-ca
    #ITOps #Alerting #Observabilité

  14. Canop'Tips 💡 Maîtrisez vos alarmes avec les compteurs #Canopsis !
    Dans un contexte où les équipes IT sont submergées d'alertes, Canopsis propose une réponse simple, visuelle et efficace : les compteurs d’alarmes.

    ✅ Donner une vision synthétique à un pilote / une équipe
    ✅ Suivre la charge opérationnelle d'un périmètre
    ✅ Augmenter la réactivité et l’efficacité des équipes
    ✅ Construire des tableaux de bord orientés pilotage

    canopsis.fr/compteurs-dalarmes/
    #OpenSource #SupervisionIT #ITOps #Alerting

  15. Как не сойти с ума с Grafana Unified Alerting: настраиваем алерт и разбираем все грабли

    В какой-то момент простого дашборда уже не хватает. Хочется, чтобы метрики не просто “где-то красиво лежали”, а сами приходили и били в лицо, когда что-то пошло не так. Разберёмся с Grafana Unified Alerting , expressions , темплейтами уведомлений и типичными ошибками, которые легко словить, если вы впервые лезете в алерты.

    habr.com/ru/articles/966902/

    #performance #android #mobile #kotlin #grafana #alerts #alerting

  16. Multi-Hazard Improves App Retention - Comparison Of Alerting & Attrition For The Multi-Hazards SD Emergency & The Single-Hazard #QuakeAlert
    --
    doi.org/10.1016/j.ijdrr.2025.1 <-- shared paper
    --
    “• Fire is responsible for over 50 % of alerts for County of San Diego, California, USA.
    • App installation rates closely mirror the timing of hazard events.
    • Multi-hazard apps retain users at a 15 % higher rate compared to single-hazard apps.
    • Higher retention improves likelihood people will receive an alert for low-frequency high-impact events like earthquakes..."
    #GIS #spatial #mapping #naturalhazards #Alert #warning #smartphone #userretention #wildfire #SanDiego #California #USA #risk #hazard #mitigation #humanimpacts #socialmedia #push #mobileapps #alerting #earlywarning #warningsystem #multihazard #fire #spatiotemporal #spatialanalysis #earthquake #tsunami #flooding #weather #earlywarning #hazardmanagement #usecase #statistics #events #effect #effectiveness #community #public #infrastructure #loss #damage #cost

  17. Prometheus 📊 L’#OpenSource au service du #monitoring et de l’#alerting

    Dans un monde IT toujours plus complexe, Prometheus s’impose comme une référence. Combiné à #Canopsis, il devient un atout majeur pour :

    ✅ Centraliser les métriques et les alertes
    ✅ Gagner en visibilité sur le SI
    ✅ Accélérer la détection et la remédiation

    Découvrez comment cette synergie renforce l’#observabilité et la performance de votre SI : canopsis.fr/prometheus-lopen-s

    #Supervision #DevOps #ITOps #DevOps #Hypervision

  18. #uk #govwarning #alerting

    The UK has just had another mass-public testing of its "severe alerting" mechanism, which makes most phones vibrate and make a sound even if the phone is on silent.

    Last time this was done (2023) it didn't go very well (no Government project the UK undertaken *ever* works, it's always a f**king disaster). This time though, it seemed to go well.

  19. Как я перестал гнаться за 100% аптаймом

    Когда я только начинал работать, 100% аптайма казались мне священным граалем. Казалось: если сервис никогда не падает — пользователи счастливы, бизнес доволен, инженеры спят спокойно. Но реальность быстро показала: каждая дополнительная «девятка» стоит всё дороже, а выгоды становятся всё менее заметными. В статье делюсь опытом: почему гонка за идеальной надёжностью — тупик, как помогает концепция Error Budget и почему лучше найти баланс между стабильностью и развитием.

    habr.com/ru/articles/941734/

    #sre #slo #sli #error_budget #devops #observability #monitoring #alerting #постмортем #oncall

  20. Как я перестал бояться алертов и полюбил дежурства

    Когда я только начинал дежурить, телефон ночью был моим главным врагом: PagerDuty вырывал из сна десятки раз, а инциденты превращались в хаос. Со временем я понял, что on-call можно превратить в предсказуемый процесс — с правильными алертами, runbook-ами и командной культурой. В этой статье расскажу, как я перестал бояться алертов и научился относиться к дежурствам спокойно. Будет личный опыт, фейлы и практические советы

    habr.com/ru/articles/941030/

    #sre #slo #sli #error_budget #devops #observability #monitoring #alerting #постмортем #oncall

  21. Как я перестал тушить пожары и начал говорить с бизнесом на языке SLO

    Когда я только начинал работать с инфраструктурой, всё выглядело как бесконечный пожар: сотни алертов, ночные звонки, хаотичные релизы и нервы на пределе. Мы гасили инциденты вручную, но проблема возвращалась снова и снова. Ситуация изменилась, когда я познакомился с практиками SRE: SLO, SLI и error budget. Они помогли превратить хаос в систему и объяснить бизнесу надёжность на понятном языке. Теперь вместо бессмысленного «сервис упал!» мы обсуждаем конкретные цифры: сколько бюджета ошибок потрачено и когда можно катить релиз. В этой статье расскажу, как мы внедрили наблюдаемость на основе golden signals, научились писать постмортемы без поиска виноватых и встроили задачи по надёжности прямо в бэклог. Всё — из реальной практики инженера, который за год прошёл путь от «тушения пожаров» к спокойной работе с прогнозируемой стабильностью. Узнать, как выйти из этого хаоса

    habr.com/ru/articles/940796/

    #sre #slo #sli #error_budget #devops #observability #monitoring #alerting #ci_cd #постмортем