МАРШРУТ
Наблюдаемость и эксплуатация сервиса
SLO, телеметрия, трассировка, алерты, инциденты и проверка восстановления.
Ожидаемый результат
Собрать минимально достаточный контур наблюдаемости и реагирования.
SLO — цель уровня сервисаЗадает целевой диапазон надежности для выбранного индикатора.Структурированное журналированиеСтруктурированный лог хранит событие как набор типизированных полей, а не только как готовую строку.Распределённая трассировкаРаспределённая трассировка связывает участки одного запроса в разных процессах и показывает их порядок, длительность и ошибки.Observability CardinalityСлишком много уникальных значений меток резко увеличивает стоимость метрик.SLO pipeline наблюдаемостиЦель по задержке, полноте и успешной доставке телеметрии от приложения до системы анализа.Модель серьёзности инцидентаУровень инцидента определяется по влиянию, масштабу и срочности, а не по громкости отдельного сигнала.Ролевая модель управления инцидентомВо время инцидента явно назначаются координация, техническое выполнение, коммуникация и ведение хронологии.Передача управления инцидентомСтруктурированная передача роли с текущим состоянием, гипотезами, рисками, следующими действиями и открытыми вопросами.Контроль действий после инцидентаКорректирующие действия получают владельца, срок, критерий завершения и проверку фактического снижения риска.Проверка восстановления после инцидентаПодтверждение по независимым сигналам, что сервис, данные и пользовательские сценарии действительно восстановлены.