Простыми словами
Систему намеренно и контролируемо подвергают сбоям, чтобы заранее увидеть, как она поведёт себя в реальной аварии. Это похоже на пожарную тренировку: цель не устроить пожар, а проверить готовность. Эксперимент начинают с малого, формулируют ожидаемый результат и имеют способ быстро остановиться.
Механизм действия
Сначала проверяют, есть ли исходное условие из определения. Затем смотрят, как оно влияет на структуру компонентов, потоки данных, ограничения и действия участников. Если эту связь не удаётся наблюдать, принцип не стоит использовать как готовое объяснение.
Пример в работе
В задаче «SRE» сразу применить привычное решение и назвать происходящее «Chaos Engineering», не проверив, действительно ли работает этот механизм. Так можно улучшить один симптом и пропустить основную причину.
Использовать «Chaos Engineering» как гипотезу: сначала определить границы ситуации и исходное состояние, затем менять только то, что связано с проверяемым механизмом, и смотреть на результат.
Ограничения
Эксперимент безопасен только при ограниченном радиусе, наблюдаемости и возможности остановки; хаотическое внесение отказов без гипотезы не является chaos engineering.
Источник
Principles of Chaos Engineering authors, “Principles of Chaos Engineering”, 2016.