home.social

#incident_management — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #incident_management, aggregated by home.social.

fetched live
  1. Как мы добавили Global Orchestration в IncidentRelay: маршрутизация алертов до создания инцидента

    Когда система мониторинга отправляет алерт, он редко выглядит так, как хотелось бы дежурному инженеру. Один источник пишет critical , другой — disaster , третий передаёт severity: 5 . В одном payload сервис называется checkout , в другом — payments-api , а в третьем его приходится угадывать по namespace. Если все эти события приходят через общий Alertmanager или webhook, одной статической настройки маршрута быстро становится недостаточно. Обычно проблему решают одним из трёх способов:

    habr.com/ru/articles/1070294/

    #incident_management #alert_routing #oncall #SRE #DevOps #open_source #selfhosted #IncidentRelay

  2. # От firing до postmortem: рабочее место дежурного поверх Grafana и Mattermost

    Grafana показывала, что горит, Mattermost доставлял уведомления, но после смены дежурного приходилось заново выяснять, кто занимается проблемой и когда ждать результат. Рассказываю, как мы собрали поверх них рабочее место с владельцами, ETA, общей историей, группировкой каскадных алертов, инцидентами и postmortem — без отдельной базы данных и без передачи управления состоянием LLM.

    habr.com/ru/articles/1065364/

    #alerting #grafana #mattermost #go #incident_management #support_team #postmortem #oncall

  3. IncidentRelay месяц спустя: от маршрутизации алертов к полноценному on-call workflow

    Чуть больше месяца назад я впервые рассказал об IncidentRelay, open-source и self-hosted системе для дежурств, маршрутизации алертов и эскалаций. В первой версии основная цепочка уже работала: Monitoring -> Route -> On-call -> Notification -> ACK / Resolve С тех пор проект добрался до v1.0.21-beta . Цепочка стала длиннее, но пользоваться системой стало проще. В отличие от некоторых корпоративных процессов, здесь усложнение действительно пошло на пользу. Не буду пересказывать весь changelog. Расскажу о нескольких изменениях, которые сильнее всего повлияли на продукт.

    habr.com/ru/articles/1050286/

    #monitoring #alertmanager #oncall #incident_management #duty

  4. IncidentRelay: self-hosted on-call, alert routing и уведомления без SaaS и канадских номеров

    Привет, Habr! Мы разрабатываем IncidentRelay - self-hosted систему для on-call scheduling, маршрутизации алертов и доставки уведомлений. Идея простая: дать командам SRE, DevOps, platform и operations понятный инструмент, который можно развернуть у себя, подключить к мониторингу и использовать без зависимости от внешней incident-management платформы.

    habr.com/ru/articles/1044068/

    #monitoring #alertmanager #oncall #incident_management #duty

  5. Multi-region quorum: «все регионы согласны» против «N из M»

    К-of-N или all-must-agree? Два подхода к quorum-логике в multi-region мониторинге. Я остановился на all-must-agree с consecutive-failure threshold. С Redis-схемой, кодом и разбором edge-кейсов где каждый подход ломается.

    habr.com/ru/articles/1035600/

    #мониторинг #quorum #SRE #false_positive #Redis #distributed_systems #alerting #threshold #uptime #incident_management

  6. Как не поехать кукухой и всё успеть: выстраиваем рабочую систему из привычек

    Уже вечер, ты активно пишешь код. Тревожность вместе с тобой. Утром на дейли сказал, что добьёшь таску: да она не сложная, каких‑то 2 стори поинта. Но вот вечер, и ты точно не успеваешь. Завтра на дейли спросят статус задачи, а ты — не сделал. Да, ты общался с архитектором по решению, отвечал на вопросы поддержки и помогал решать проблемы с тестовым окружением. Ещё был синк с другой командой, помог решить проблему с локальным окружением другому разработчику и готовил контракт для фронта для будущей таски. И на обед ты не сходил. Но кого это заботит, если твоя задача все ещё в InDev? Точно придётся посидеть ещё пару часов ночью, чтобы закрыть должок. Или другой вариант. Ты — менеджер. У тебя за день от 5–6 встреч. Всё нужно решить. Ну и текучка не отпускает: нужно решить конфликт в команде «А», есть запрос на согласование обучения для Иванова, нужно ещё согласовать технические работы и выдать пару доступов. А ещё Сергей из команды «B» недостаточно открыто ответил на вопрос своего коллеги, и тут просят твоего внимания. И, кстати, ещё нужно запланировать изменение процесса и предложить расчёт новой метрики. Знакомо? Тогда тебе точно нужен курс по time management ряд привычек, которые каждый может внедрить в свою работу.

    habr.com/ru/articles/1004270/

    #soft_skills #soft_skills_руководителя #soft_skills_для_разработчиков #time_management #knowledge_management #incident_management #communication

  7. Как мы случайно сделали стартап, пока учили ИИ работать с реальной инфраструктурой

    Когда мы впервые увидели AI-чаты, это выглядело впечатляюще. Они писали код, помогали с документацией, объясняли архитектурные решения. Это было хорошо. Но довольно быстро стало понятно главное:

    habr.com/ru/articles/980648/

    #DevOps #SRE #Kubernetes #AI #LLM #Production #Infrastructure #SSH #Incident_management #Automation

  8. Следствие вели, или Культура инцидент- и проблем-менеджмента в Ozon

    Обрыв каналов связи, багованный релиз, мискоммуникация… Серия загадочных событий, авантюрный детектив из цикла «Следствие вели…» — нет, не с Леонидом Каневским, и даже не Колобки, а команда разбора инцидентов, или просто Post. Хей-хей! Я Юля, и я специалист по сопровождению инцидентов в команде Post департамента SRE (Site Reliability Engineering). Когда я рассказываю своим друзьям, чем я занимаюсь на работе, мне часто говорят, что я работаю в детективном агентстве. Поэтому сегодня поговорим о том, как устроено управление инцидентами и проблемами в Ozon и чем оно схоже с работой детективов. Статья-расследование будет интересна всем, кто хоть раз задумывался о том, как большие компании не только справляются с форс-мажорами, но и учатся на своих ошибках. Расскажу о внутренней кухне и почему инцидент- и проблем-менеджмент — не «бюрократия», а палочка-выручалочка на пути к стабильности. Вперед вперед!

    habr.com/ru/companies/ozontech

    #incident_management #incident #problem_management #postmortem #troubleshooting #инцидентменеджмент #управление_проблемами #управление_инцидентами #sre