#site_reliability_engineering — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #site_reliability_engineering, aggregated by home.social.
-
Как мониторить Java-приложения: метрики, алерты и правило 80/20
Хороший мониторинг помогает быстро понять, что происходит с приложением и куда смотреть в первую очередь. Для этого не нужно пытаться измерить всё: базовый набор технических метрик покрывает большинство типовых проблем, а бизнес-метрики, SLO и анализ аномалий помогают заранее замечать нетипичные отклонения. В Календаре мы называем этот подход правилом 80/20 . Всем привет! Меня зовут Настя, я бэкенд-разработчик в Яндекс 360 и отвечаю за надёжность Календаря. В этой статье я покажу, какие метрики стоит взять за основу, как выбирать полезные алерты и чем дополнять базовый набор для оставшихся 20%.
https://habr.com/ru/companies/yandex/articles/1068874/
#мониторинг #метрики #алертинг #java #devops #sre #site_reliability_engineering #надежность #инцидентменеджмент
-
Пять самых крупных ошибок, которые допускают компании при внедрении SRE
SRE часто внедряют как набор инструментов, дашбордов и новых должностей, но через полгода команда всё так же тушит инциденты по ночам, а бюджеты ошибок живут только в таблицах. В статье разбираем 5 типичных провалов при внедрении SRE: от формального переименования эксплуатации до поспешной покупки AIOps без нормального observability. Это разбор о том, почему надежность ломается не только в инфраструктуре, но и в процессах, метриках, найме и управленческих стимулах. Разобрать ошибки
https://habr.com/ru/companies/otus/articles/1040050/
#Site_Reliability_Engineering #SRE #надежность_систем #распределенные_системы #мониторинг #observability #slo #бюджет_ошибок #инциденты