Хороший мониторинг помогает быстро понять, что происходит с приложением и куда смотреть в первую очередь. Для этого не нужно пытаться измерить всё: базовый набор технических метрик покрывает большинство типовых проблем, а бизнес-метрики, SLO и анализ аномалий помогают заранее замечать нетипичные отклонения. В Календаре мы называем этот подход правилом 80/20.
Всем привет! Меня зовут Настя, я бэкенд-разработчик в Яндекс 360 и отвечаю за надёжность Календаря. В этой статье я покажу, какие метрики стоит взять за основу, как выбирать полезные алерты и чем дополнять базовый набор для оставшихся 20%.
Почему перебор метрик убивает мониторинг
Если собрать разработчиков и спросить у них, хорошо ли, когда метрик много, то подавляющее большинство с этим тезисом согласится. К слову, я тоже. Нам хочется понимать, хорошо ли у нас всё работает, и вовремя узнавать, если где-то что-то идёт не так. Мы хотим кучу метрик, хотим оперативного подсвечивания инцидентов, вызова дежурных и прочего.