#alerting — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #alerting, aggregated by home.social.
-
Как мы внедрили AIOps для контроля GPU‑утилизации и повысили её на 60%
Привет, Хабр! На связи Даниил Понизов и Роман Лазовский , руководитель и MLOps-инженер команды ML-платформы в RWB. Мы занимаемся разработкой платформы машинного обучения, в том числе — контролируем инфраструктуру и эффективное использование ресурсов. В этой статье мы расскажем, как пришли к внедрению AIOps-подхода для работы с алертами по утилизации ресурсов, почему стандартные методы перестали работать и как автоматизация помогла нам повысить среднюю месячную утилизацию GPU на отдельных кластерах более чем на 60%.
https://habr.com/ru/companies/rwb/articles/1069556/
#AIOps #mlops #gpu #inference #monitoring #observability #engineering #alertmanager #alerting #duty
-
A practical pillar page on alerting design, routing, noise reduction, and human response across observability systems, paging tools, and chat platforms.
-
# От firing до postmortem: рабочее место дежурного поверх Grafana и Mattermost
Grafana показывала, что горит, Mattermost доставлял уведомления, но после смены дежурного приходилось заново выяснять, кто занимается проблемой и когда ждать результат. Рассказываю, как мы собрали поверх них рабочее место с владельцами, ETA, общей историей, группировкой каскадных алертов, инцидентами и postmortem — без отдельной базы данных и без передачи управления состоянием LLM.
https://habr.com/ru/articles/1065364/
#alerting #grafana #mattermost #go #incident_management #support_team #postmortem #oncall
-
Зоопарк протоколов и человеческий фактор: что внутри сложной IoT-интеграции климатического оборудования
Мониторинг температуры в холодильном оборудовании кажется простой задачей. Особенно если речь идет всего о нескольких десятках ларей на одном производственном участке. Но когда эти лари от разных вендоров, с разными протоколами, и их еще и перемещают по цеху, задача перестает быть тривиальной. В этой статье в блоге ЛАНИТ - опыт внедрения IoT-решения без замены оборудования, с примерами ошибок и неочевидных решений. Материал будет полезен тем, кто сталкивается с промышленным мониторингом, выбирает между машинным обучением и простой логикой или пытается подружить разнородное оборудование и создать из него единую систему.
https://habr.com/ru/companies/lanit/articles/1050492/
#iot #промышленный_интернет_вещей #мониторинг #alerting #MES #производство #беспроводные_датчики #инцидентменеджмент #ЛАНИТ
-
Heartbeat-мониторинг cron-job'ов: dead-man-switch на FastAPI
Обычный uptime-мониторинг проверяет, отвечает ли сервис на запросы. Cron-job ничего не отвечает — он запускается раз в N часов, делает работу и молча завершается. Если cron перестал запускаться (uptime daemon упал, машина в read-only mode после fsck, disk full) — обычный мониторинг этого не видит. Решение известно с 70-х — паттерн dead-man-switch (он же heartbeat). Я недавно делал heartbeat-эндпоинты для Valpero. Здесь разберу серверную часть на FastAPI + клиентский bash-pattern, и edge-кейсы которые их ломают. В конце готовый код, который можно адаптировать под свой стек.
https://habr.com/ru/articles/1035624/
#cron #heartbeat #deadmanswitch #monitoring #alerting #bash #FastAPI #Celery #devops #linux
-
Multi-region quorum: «все регионы согласны» против «N из M»
К-of-N или all-must-agree? Два подхода к quorum-логике в multi-region мониторинге. Я остановился на all-must-agree с consecutive-failure threshold. С Redis-схемой, кодом и разбором edge-кейсов где каждый подход ломается.
https://habr.com/ru/articles/1035600/
#мониторинг #quorum #SRE #false_positive #Redis #distributed_systems #alerting #threshold #uptime #incident_management
-
Deep dive on Slack webhooks and apps for alerts, approvals, and workflow automation. Block Kit buttons, signature verification, Go and Python examples.
#integration #alerting #observability #golang #python #Architecture #Dev #Go
https://www.glukhov.org/app-architecture/integration-patterns/slack/
-
Deep dive on Discord webhooks and bots for alerts, approvals, and human-in-the-loop control. Go and Python examples, security, idempotency, and routing.
#integration #observability #alerting #bots #python #Architecture #Dev #Go #Golang
https://www.glukhov.org/app-architecture/integration-patterns/discord/
-
A practical pillar page on alerting design, routing, noise reduction, and human response across observability systems, paging tools, and chat platforms.
-
Колобок-стек: я от бабушки ушёл, или как мы написали свой сервер алертов на 16 МБ
Pusk — self-hosted сервер алертов на 16 МБ. Один бинарник, без внешних сервисов, частично совместим с Telegram Bot API (13 методов из 80+). Типичная ситуация: несколько серверов, Zabbix собирает метрики, Python‑боты шлют алерты в Telegram. У кого‑то это веб‑проект, у кого‑то видеонаблюдение, у кого‑то живые эфиры, где 2 минут без алерта = зрители видят чёрный экран. Работало годами. А потом канал до API отвалился. Причина неважна — лимиты, блокировки, авария на стороне провайдера. Алерты встали. Нужен был свой канал доставки, который не зависит от внешних сервисов. Покатились →
https://habr.com/ru/articles/1018932/
#pusk #selfhosted #alerting #telegram_bot_api #go #sqlite #devops #monitoring #alertmanager #pwa
-
#Gotify + #Canopsis 🎯 A vous les #Notifications ciblées et instantanées !
Dans le cadre de la #Supervision et de l'#Hypervision, recevoir rapidement et de manière claire les bonnes informations peut faire toute la différence... Surtout en dehors des heures ouvrées ou pendant les #Astreintes.
Découvrez comment cette intégration simple et puissante améliore votre réactivité opérationnelle dans ce nouvel article :
https://www.canopsis.fr/gotify-canopsis-pour-des-notifications-ciblees-et-immediates-lunion-fait-la-force/ -
#CanopTips 💡 Testez vos règles Canopsis en toute autonomie grâce à l'enregistrement d'événements !
Valider des règles d’enrichissement, de corrélation ou des scénarios nécessite souvent de redemander des événements aux clients, ce qui peut être contraignant et chronophage.
Avec l'enregistrement d’événements de #Canopsis, cette dépendance disparaît.
🔗 https://www.canopsis.fr/enregistrement-d-evenements/
#SupervisionIT #Hypervision #ITOps #Observabilité #EventManagement #Alerting #OpenSource #Monitoring #SI -
Canopsis × #Teams 🔔 Quand l’alarme sort de la console d’#Hypervision pour arriver là où travaillent les équipes !
Avec l’intégration #Canopsis × Teams, les alertes sont notifiées au bon moment, au bon endroit et aux bonnes personnes.
Au-delà du message brut, la notification devient un véritable support de communication clair et synthétique.
👉 Moins de friction, plus de réactivité et une #Collaboration réellement efficace !
https://www.canopsis.fr/microsoft-teams-canopsis-la-notification-au-service-des-equipes/
#ITOps #Alerting #Observabilité -
Canop'Tips 💡 Maîtrisez vos alarmes avec les compteurs #Canopsis !
Dans un contexte où les équipes IT sont submergées d'alertes, Canopsis propose une réponse simple, visuelle et efficace : les compteurs d’alarmes.✅ Donner une vision synthétique à un pilote / une équipe
✅ Suivre la charge opérationnelle d'un périmètre
✅ Augmenter la réactivité et l’efficacité des équipes
✅ Construire des tableaux de bord orientés pilotagehttps://www.canopsis.fr/compteurs-dalarmes/
#OpenSource #SupervisionIT #ITOps #Alerting -
Как не сойти с ума с Grafana Unified Alerting: настраиваем алерт и разбираем все грабли
В какой-то момент простого дашборда уже не хватает. Хочется, чтобы метрики не просто “где-то красиво лежали”, а сами приходили и били в лицо, когда что-то пошло не так. Разберёмся с Grafana Unified Alerting , expressions , темплейтами уведомлений и типичными ошибками, которые легко словить, если вы впервые лезете в алерты.
https://habr.com/ru/articles/966902/
#performance #android #mobile #kotlin #grafana #alerts #alerting
-
I also published an article on how to set up alerting for systemd units.
>_
-
New #Documentation: Monitoring a UPS with Telegraf and Grafana
Author: Ben Tasker -
Multi-Hazard Improves App Retention - Comparison Of Alerting & Attrition For The Multi-Hazards SD Emergency & The Single-Hazard #QuakeAlert
--
https://doi.org/10.1016/j.ijdrr.2025.105832 <-- shared paper
--
“• Fire is responsible for over 50 % of alerts for County of San Diego, California, USA.
• App installation rates closely mirror the timing of hazard events.
• Multi-hazard apps retain users at a 15 % higher rate compared to single-hazard apps.
• Higher retention improves likelihood people will receive an alert for low-frequency high-impact events like earthquakes..."
#GIS #spatial #mapping #naturalhazards #Alert #warning #smartphone #userretention #wildfire #SanDiego #California #USA #risk #hazard #mitigation #humanimpacts #socialmedia #push #mobileapps #alerting #earlywarning #warningsystem #multihazard #fire #spatiotemporal #spatialanalysis #earthquake #tsunami #flooding #weather #earlywarning #hazardmanagement #usecase #statistics #events #effect #effectiveness #community #public #infrastructure #loss #damage #cost -
Prometheus 📊 L’#OpenSource au service du #monitoring et de l’#alerting
Dans un monde IT toujours plus complexe, Prometheus s’impose comme une référence. Combiné à #Canopsis, il devient un atout majeur pour :
✅ Centraliser les métriques et les alertes
✅ Gagner en visibilité sur le SI
✅ Accélérer la détection et la remédiationDécouvrez comment cette synergie renforce l’#observabilité et la performance de votre SI : https://www.canopsis.fr/prometheus-lopen-source-au-service-du-monitoring-et-de-lalerting/
-
SQL performance improvements: finding the right queries to fix
https://ohdear.app/news-and-updates/sql-performance-improvements-finding-the-right-queries-to-fix-part-1
#ycombinator #https #ssl #tls #certificate #mixed_content #monitoring #alerting #status_pages #performance -
The UK has just had another mass-public testing of its "severe alerting" mechanism, which makes most phones vibrate and make a sound even if the phone is on silent.
Last time this was done (2023) it didn't go very well (no Government project the UK undertaken *ever* works, it's always a f**king disaster). This time though, it seemed to go well.
-
Cloudflare 沒抓到 1.1.1.1 憑證錯發的問題
#alert #alerting #ca #certificate #cloudflare #ct #dns #fina #hackerone #list #mailing #microsoft #monitor #monitoring #tls #transparency #windows
-
Как я перестал гнаться за 100% аптаймом
Когда я только начинал работать, 100% аптайма казались мне священным граалем. Казалось: если сервис никогда не падает — пользователи счастливы, бизнес доволен, инженеры спят спокойно. Но реальность быстро показала: каждая дополнительная «девятка» стоит всё дороже, а выгоды становятся всё менее заметными. В статье делюсь опытом: почему гонка за идеальной надёжностью — тупик, как помогает концепция Error Budget и почему лучше найти баланс между стабильностью и развитием.
https://habr.com/ru/articles/941734/
#sre #slo #sli #error_budget #devops #observability #monitoring #alerting #постмортем #oncall
-
Как я перестал бояться алертов и полюбил дежурства
Когда я только начинал дежурить, телефон ночью был моим главным врагом: PagerDuty вырывал из сна десятки раз, а инциденты превращались в хаос. Со временем я понял, что on-call можно превратить в предсказуемый процесс — с правильными алертами, runbook-ами и командной культурой. В этой статье расскажу, как я перестал бояться алертов и научился относиться к дежурствам спокойно. Будет личный опыт, фейлы и практические советы
https://habr.com/ru/articles/941030/
#sre #slo #sli #error_budget #devops #observability #monitoring #alerting #постмортем #oncall
-
Как я перестал тушить пожары и начал говорить с бизнесом на языке SLO
Когда я только начинал работать с инфраструктурой, всё выглядело как бесконечный пожар: сотни алертов, ночные звонки, хаотичные релизы и нервы на пределе. Мы гасили инциденты вручную, но проблема возвращалась снова и снова. Ситуация изменилась, когда я познакомился с практиками SRE: SLO, SLI и error budget. Они помогли превратить хаос в систему и объяснить бизнесу надёжность на понятном языке. Теперь вместо бессмысленного «сервис упал!» мы обсуждаем конкретные цифры: сколько бюджета ошибок потрачено и когда можно катить релиз. В этой статье расскажу, как мы внедрили наблюдаемость на основе golden signals, научились писать постмортемы без поиска виноватых и встроили задачи по надёжности прямо в бэклог. Всё — из реальной практики инженера, который за год прошёл путь от «тушения пожаров» к спокойной работе с прогнозируемой стабильностью. Узнать, как выйти из этого хаоса
https://habr.com/ru/articles/940796/
#sre #slo #sli #error_budget #devops #observability #monitoring #alerting #ci_cd #постмортем