SYSTEM ATLASЗагрузка материала

Chaos Engineering

Chaos Engineering

Надежность проверяется контролируемыми сбоями, а не предположениями.

Простыми словами

Систему намеренно и контролируемо подвергают сбоям, чтобы заранее увидеть, как она поведёт себя в реальной аварии. Это похоже на пожарную тренировку: цель не устроить пожар, а проверить готовность. Эксперимент начинают с малого, формулируют ожидаемый результат и имеют способ быстро остановиться.

Механизм действия

Сначала проверяют, есть ли исходное условие из определения. Затем смотрят, как оно влияет на структуру компонентов, потоки данных, ограничения и действия участников. Если эту связь не удаётся наблюдать, принцип не стоит использовать как готовое объяснение.

Пример в работе

Нерабочий подход

В задаче «SRE» сразу применить привычное решение и назвать происходящее «Chaos Engineering», не проверив, действительно ли работает этот механизм. Так можно улучшить один симптом и пропустить основную причину.

Системный подход

Использовать «Chaos Engineering» как гипотезу: сначала определить границы ситуации и исходное состояние, затем менять только то, что связано с проверяемым механизмом, и смотреть на результат.

Ограничения

Эксперимент безопасен только при ограниченном радиусе, наблюдаемости и возможности остановки; хаотическое внесение отказов без гипотезы не является chaos engineering.

Источник

Principles of Chaos Engineering authors, “Principles of Chaos Engineering”, 2016.

Первоисточник