#incident_management — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #incident_management, aggregated by home.social.
-
Как мы добавили Global Orchestration в IncidentRelay: маршрутизация алертов до создания инцидента
Когда система мониторинга отправляет алерт, он редко выглядит так, как хотелось бы дежурному инженеру. Один источник пишет critical , другой — disaster , третий передаёт severity: 5 . В одном payload сервис называется checkout , в другом — payments-api , а в третьем его приходится угадывать по namespace. Если все эти события приходят через общий Alertmanager или webhook, одной статической настройки маршрута быстро становится недостаточно. Обычно проблему решают одним из трёх способов:
https://habr.com/ru/articles/1070294/
#incident_management #alert_routing #oncall #SRE #DevOps #open_source #selfhosted #IncidentRelay
-
# От firing до postmortem: рабочее место дежурного поверх Grafana и Mattermost
Grafana показывала, что горит, Mattermost доставлял уведомления, но после смены дежурного приходилось заново выяснять, кто занимается проблемой и когда ждать результат. Рассказываю, как мы собрали поверх них рабочее место с владельцами, ETA, общей историей, группировкой каскадных алертов, инцидентами и postmortem — без отдельной базы данных и без передачи управления состоянием LLM.
https://habr.com/ru/articles/1065364/
#alerting #grafana #mattermost #go #incident_management #support_team #postmortem #oncall
-
IncidentRelay месяц спустя: от маршрутизации алертов к полноценному on-call workflow
Чуть больше месяца назад я впервые рассказал об IncidentRelay, open-source и self-hosted системе для дежурств, маршрутизации алертов и эскалаций. В первой версии основная цепочка уже работала: Monitoring -> Route -> On-call -> Notification -> ACK / Resolve С тех пор проект добрался до v1.0.21-beta . Цепочка стала длиннее, но пользоваться системой стало проще. В отличие от некоторых корпоративных процессов, здесь усложнение действительно пошло на пользу. Не буду пересказывать весь changelog. Расскажу о нескольких изменениях, которые сильнее всего повлияли на продукт.
https://habr.com/ru/articles/1050286/
#monitoring #alertmanager #oncall #incident_management #duty
-
IncidentRelay: self-hosted on-call, alert routing и уведомления без SaaS и канадских номеров
Привет, Habr! Мы разрабатываем IncidentRelay - self-hosted систему для on-call scheduling, маршрутизации алертов и доставки уведомлений. Идея простая: дать командам SRE, DevOps, platform и operations понятный инструмент, который можно развернуть у себя, подключить к мониторингу и использовать без зависимости от внешней incident-management платформы.
https://habr.com/ru/articles/1044068/
#monitoring #alertmanager #oncall #incident_management #duty
-
Multi-region quorum: «все регионы согласны» против «N из M»
К-of-N или all-must-agree? Два подхода к quorum-логике в multi-region мониторинге. Я остановился на all-must-agree с consecutive-failure threshold. С Redis-схемой, кодом и разбором edge-кейсов где каждый подход ломается.
https://habr.com/ru/articles/1035600/
#мониторинг #quorum #SRE #false_positive #Redis #distributed_systems #alerting #threshold #uptime #incident_management
-
Как не поехать кукухой и всё успеть: выстраиваем рабочую систему из привычек
Уже вечер, ты активно пишешь код. Тревожность вместе с тобой. Утром на дейли сказал, что добьёшь таску: да она не сложная, каких‑то 2 стори поинта. Но вот вечер, и ты точно не успеваешь. Завтра на дейли спросят статус задачи, а ты — не сделал. Да, ты общался с архитектором по решению, отвечал на вопросы поддержки и помогал решать проблемы с тестовым окружением. Ещё был синк с другой командой, помог решить проблему с локальным окружением другому разработчику и готовил контракт для фронта для будущей таски. И на обед ты не сходил. Но кого это заботит, если твоя задача все ещё в InDev? Точно придётся посидеть ещё пару часов ночью, чтобы закрыть должок. Или другой вариант. Ты — менеджер. У тебя за день от 5–6 встреч. Всё нужно решить. Ну и текучка не отпускает: нужно решить конфликт в команде «А», есть запрос на согласование обучения для Иванова, нужно ещё согласовать технические работы и выдать пару доступов. А ещё Сергей из команды «B» недостаточно открыто ответил на вопрос своего коллеги, и тут просят твоего внимания. И, кстати, ещё нужно запланировать изменение процесса и предложить расчёт новой метрики. Знакомо? Тогда тебе точно нужен курс по time management ряд привычек, которые каждый может внедрить в свою работу.
https://habr.com/ru/articles/1004270/
#soft_skills #soft_skills_руководителя #soft_skills_для_разработчиков #time_management #knowledge_management #incident_management #communication
-
Как мы случайно сделали стартап, пока учили ИИ работать с реальной инфраструктурой
Когда мы впервые увидели AI-чаты, это выглядело впечатляюще. Они писали код, помогали с документацией, объясняли архитектурные решения. Это было хорошо. Но довольно быстро стало понятно главное:
https://habr.com/ru/articles/980648/
#DevOps #SRE #Kubernetes #AI #LLM #Production #Infrastructure #SSH #Incident_management #Automation
-
NEW: Six months after discovering an attack, Northwest Radiologists notifies almost 350,000 Washington State residents
#databreach #incident_management #healthsec #HIPAA #SecurityRule #PrivacyRule
-
Следствие вели, или Культура инцидент- и проблем-менеджмента в Ozon
Обрыв каналов связи, багованный релиз, мискоммуникация… Серия загадочных событий, авантюрный детектив из цикла «Следствие вели…» — нет, не с Леонидом Каневским, и даже не Колобки, а команда разбора инцидентов, или просто Post. Хей-хей! Я Юля, и я специалист по сопровождению инцидентов в команде Post департамента SRE (Site Reliability Engineering). Когда я рассказываю своим друзьям, чем я занимаюсь на работе, мне часто говорят, что я работаю в детективном агентстве. Поэтому сегодня поговорим о том, как устроено управление инцидентами и проблемами в Ozon и чем оно схоже с работой детективов. Статья-расследование будет интересна всем, кто хоть раз задумывался о том, как большие компании не только справляются с форс-мажорами, но и учатся на своих ошибках. Расскажу о внутренней кухне и почему инцидент- и проблем-менеджмент — не «бюрократия», а палочка-выручалочка на пути к стабильности. Вперед вперед!
https://habr.com/ru/companies/ozontech/articles/925046/
#incident_management #incident #problem_management #postmortem #troubleshooting #инцидентменеджмент #управление_проблемами #управление_инцидентами #sre
-
Tracking developer build times to decide if the M3 MacBook is worth upgrading
https://incident.io/blog/festive-macbooks
#ycombinator #incident #incident_management #incident_response #post_mortem #outage #slack_incident #incident_channel