Инциденты и постмортемы: как надёжность делают процессом
Технические паттерны устойчивости не работают без процесса вокруг них: как устроен инцидент-менеджмент (роли, severity, коммуникация), почему постмортемы должны быть блеймлесс (иначе люди прячут причины), как из инцидента рождаются action items и runbooks, и как политика error budget превращает надёжность из лозунга в решения о релизах. SRE-сторона отказоустойчивости