6.2 Метрики инцидентов: обнаружение, реагирование и восстановление
Обзор и мотивация
Эта тема измеряет то, что происходит, когда бюджет ошибок из темы 6.1 расходуется через фактический отказ: инцидент, незапланированное событие, ухудшающее или прерывающее сервис. Четыре метрики формируют стандартный словарь для измерения того, насколько хорошо организация с этим справляется: среднее время до обнаружения (MTTD), сколько времени до того, как организация замечает, что что-то не так; среднее время до подтверждения (MTTA), сколько времени до того, как кто-то берёт на себя ответственность за реагирование; среднее время до решения или восстановления (MTTR), сколько времени до восстановления сервиса, та же концепция, которую тема 2.10 охватывала конкретно для отказов, вызванных развёртыванием, теперь обобщённая на любой инцидент независимо от причины; и частота инцидентов, просто как часто инциденты вообще происходят.
Центральная забота этой темы, отражающая обращение темы 2.10 с долей неудачных изменений, в том, что эти числа заслуживают доверия настолько, насколько заслуживает доверия организационная культура вокруг честного сообщения и классификации инцидентов. Команда, боящаяся обвинения за инцидент, имеет все стимулы недосообщать, откладывать подтверждение, чтобы избежать быть «на часах», или классифицировать серьёзное событие как незначительное, чтобы защитить собственные метрики. Практика безвиновного разбора инцидента, впервые разработанная в таких организациях, как Etsy, и формализованная в литературе SRE Google, существует именно для устранения этого стимула, и эта тема относится к ней как к предпосылке для заслуживающих доверия данных инцидентов, а не опциональной культурной любезности, наложенной поверх метрик.
Для крупных команд метрики инцидентов раскрывают, действительно ли работает способность организации обнаруживать и реагировать, инструментарий отката темы 2.10 среди других инвестиций, в реальных, разнообразных условиях, а не только в конкретном сценарии отказа, вызванного развёртыванием, который охватывала та тема. Корпоративные и государственные организации, управляющие критической инфраструктурой, зависят от этих метрик и внутренне, для движения подлинного операционного улучшения, и внешне, чтобы продемонстрировать клиентам, регуляторам или публике, что инциденты обрабатываются компетентно и улучшаются со временем.
Ключевые принципы
- Безвиновная культура предпосылка для заслуживающих доверия данных инцидентов, а не опциональное дополнение; страх обвинения разрушает и сообщение, и скорость подтверждения, и классификацию серьёзности одинаково.
- Обнаружение, подтверждение и решение отдельные фазы с отдельными исправлениями. Медленное общее время восстановления может скрывать очень разные лежащие в основе проблемы в зависимости от того, какая фаза фактически медленная.
- Частота инцидентов и MTTR это парный сигнал, похожий на долю неудачных изменений и время восстановления DORA (тема 2.10): ни один по отдельности не рассказывает полную историю.
- Классификация серьёзности нуждается в той же строгости, что классификация утёкших дефектов (тема 5.1): последовательные, задокументированные критерии, а не специальное суждение.
- Ценность разбора инцидента в системном обучении, а не в производстве числа. Метрика побочный продукт хорошей практики, а не её цель.
Рекомендации
Разбивайте время реагирования на инцидент на его отдельные фазы
Измеряйте и сообщайте время обнаружения (от фактического начала отказа до того, как кто-то замечает), время подтверждения (от уведомления до того, как кто-то берёт на себя ответственность) и время решения (от ответственности до подлинного восстановления) отдельно, а не только единую, смешанную сумму. Каждая фаза указывает на другое исправление: медленное обнаружение указывает на пробел мониторинга и оповещения, медленное подтверждение указывает на проблему процесса дежурства или эскалации, а медленное решение указывает на пробел инструментария, руководства по эксплуатации или диагностической способности (тема 2.10 охватывает это конкретно для отказов, вызванных развёртыванием).
Стройте и защищайте подлинно безвиновный процесс разбора инцидента
Безвиновный разбор инцидента исследует, что произошло и почему система позволила этому произойти, явно избегая приписывания вины отдельному человеку за ошибку, которую любой разумный человек в тех же обстоятельствах, с той же информацией, мог бы правдоподобно совершить. Активно защищайте эту дисциплину: моделирование руководством некарательных ответов на инциденты, явная письменная политика и привычка спрашивать «что в нашей системе позволило этому произойти» вместо «кто это сделал» все необходимые, постоянные инвестиции, а не разовое политическое заявление.
Классифицируйте серьёзность с последовательными, задокументированными, проверяемыми аудитом критериями
Применяйте ту же дисциплину, которую тема 5.1 рекомендует для утёкших дефектов, к классификации серьёзности инцидентов: фиксированная, задокументированная шкала, основанная на фактическом воздействии на клиента или бизнес, применяемая последовательно между командами, периодически проверяемая аудитом на дрейф. Непоследовательная классификация, некоторые команды щедрые, некоторые строгие, делает общеорганизационные данные инцидентов такими же ненадёжными для сравнения, как были бы непоследовательно классифицированные данные дефектов.
Отслеживайте частоту инцидентов и MTTR вместе, никогда изолированно
Улучшающийся MTTR наряду с растущей частотой инцидентов может указывать на команду, становящуюся лучше в тушении пожаров, пока лежащая в основе надёжность системы фактически деградирует; падающая частота инцидентов наряду с ухудшающимся MTTR может указывать на более редкие, но более серьёзные, труднее диагностируемые отказы, заменяющие частые незначительные. Пересматривайте оба вместе, точно отражая дисциплину сочетания скорости и стабильности из метрик DORA части 2, чтобы получить честную объединённую картину.
Извлекайте и отслеживайте системные пункты действий из разборов инцидентов, а не только метрики
Реальная ценность процесса разбора инцидента в конкретных, системных пунктах действий, которые он производит: добавленное отсутствующее оповещение, улучшенное руководство по эксплуатации, устранённая единая точка отказа. Отслеживайте эти пункты действий до завершения с той же дисциплиной, что бэклог технического долга из темы 4.5, поскольку разбор инцидента, производящий понимание, но не последующие действия, тратит впустую организационное обучение, которое процесс призван захватить.
Компромиссы: плюсы и минусы
| Подход | Плюсы | Минусы |
|---|---|---|
| Смешанная, единая метрика времени реагирования на инцидент | Просто сообщать | Скрывает, какая конкретно фаза, обнаружение, подтверждение, решение, фактическая проблема |
| Метрики инцидентов, разбитые по фазам | Диагностичны, указывают прямо на правильное исправление | Требует более тщательной инструментации каждого перехода фазы |
| Обвинительно ориентированный пересмотр инцидента | Ощущается подотчётным, удовлетворяет желание назначить ответственность | Разрушает честность будущего сообщения и редко исправляет фактическую системную причину |
| Безвиновная практика разбора инцидента | Производит честные данные и подлинные системные исправления | Требует устойчивой культурной инвестиции и дисциплины руководства для поддержания |
Центральное напряжение: привлекательность индивидуальной подотчётности против практической потребности в честном сообщении. Обвинение отдельного человека после инцидента может ощущаться удовлетворяющим и может выглядеть как решительное руководство, но оно надёжно разрушает данные каждого будущего инцидента, потому что люди недосообщают, откладывают подтверждение или неправильно классифицируют серьёзность, как только начинают бояться личных последствий. Разрешайте напряжение в пользу безвиновной практики сознательно и последовательно, понимая, что подлинная подотчётность приходит от исправления системы, позволившей отказ, а не от наказания человека, случайно присутствовавшего, когда это произошло.
Вопросы для обсуждения в команде
Разбиваем ли мы время реагирования на инцидент на фазы обнаружения, подтверждения и решения, или отслеживаем только единое смешанное число? Если существует только смешанное число, выберите недавний значимый инцидент и попытайтесь реконструировать разбивку по фазам ретроактивно, чтобы увидеть, что бы она раскрыла.
Подлинно ли верила бы наша команда, что наш процесс разбора инцидента безвиновный, или страх последствий всё ещё формирует то, как сообщаются и обсуждаются инциденты? Спросите это напрямую и честно; заявленная безвиновная политика, которой фактически не живут, не производит заслуживающих доверия данных.
Классифицировали бы две разные команды серьёзность одного и того же инцидента одинаково? Выберите реальный, неоднозначный прошлый инцидент, и пусть представители разных команд классифицируют его независимо, затем сравните результаты.
Пересматриваем ли мы частоту инцидентов и MTTR вместе, или одному уделяется больше внимания, чем другому? Проверьте вашу фактическую практику отчётности и пересмотров на это сочетание, отражая ту же дисциплину, которую тема 2.10 рекомендует для метрик стабильности DORA.
Какой процент наших пунктов действий из разбора инцидента за последние шесть месяцев фактически был завершён? Если вы сейчас это не отслеживаете, этот пробел стоит назвать; процесс разбора инцидента с низкой долей завершения пунктов действий производит понимание без последующих действий.
Заставлял ли когда-либо страх обвинения кого-то отложить сообщение или подтверждение инцидента? Это неудобный, но важный вопрос; честный ответ «да, и вот что произошло» гораздо более ценен для здоровья вашего процесса инцидентов, чем рефлекторное «нет».
Отраслевой взгляд
Стартап. Реагирование на инциденты часто по необходимости неформально с маленькой командой, и формальное разбиение по фазам может быть не нужно сначала. Привычка, стоящая принятия рано, это безвиновные нормы обсуждения с самого первого инцидента, поскольку культурные привычки, установленные рано, гораздо легче поддерживать, чем переделывать, как только укоренился обвинительный паттерн.
Малый бизнес. Простой, общий журнал инцидентов, даже неформальный, с базовой классификацией серьёзности и кратким безвиновным ретроспективным разбором для чего-либо значимого, захватывает большую часть ценности этой темы без необходимости в сложном инструментарии или выделенной платформе управления инцидентами.
Корпорация. Последовательная классификация серьёзности и подлинная, устойчивая безвиновная культура обе труднее поддерживать в масштабе, и обе существенны для заслуживающих доверия, сравнимых данных инцидентов по десяткам команд. Инвестируйте в задокументированные критерии классификации, периодический аудит и активное моделирование руководством безвиновного ответа, поскольку культурный дрейф к обвинению имеет тенденцию постепенно закрадываться без сознательного, постоянного противодавления.
Государство. Инциденты, затрагивающие общественные услуги или критическую инфраструктуру, часто сталкиваются с внешней проверкой, вниманием СМИ или формальным расследованием, что создаёт сильное давление к поиску виноватых, способное напрямую подорвать внутреннюю безвиновную практику, если не управляется активно. Поддерживайте ясную внутреннюю безвиновную дисциплину для подлинного системного обучения, отдельную от любого процесса внешней подотчётности, который может последовать за серьёзным инцидентом, и ясно сообщайте это различие персоналу.
Примеры
Корпорация. Инженерная культура платёжной компании годами неформально относилась к инцидентам как к тому, что нужно минимизировать быстрым подтверждением, чтобы не выглядеть ответственным, что приводило к последовательно плохим временам обнаружения и подтверждения, которые руководство изначально приписывало неадекватному инструментарию мониторинга. Культурный сдвиг к подлинно безвиновным разборам инцидентов, включая публичную и конкретную похвалу руководства за быстрое, честное подтверждение инцидента, а не только похвалу за быстрое решение, произвёл измеримое улучшение и во времени обнаружения, и во времени подтверждения в течение двух кварталов, раскрыв, что исходное узкое место было культурным, страхом обвинения, а не техническим, неадекватным инструментарием, как изначально предполагалось.
Государство. Операционный центр агентства общественного транспорта исторически классифицировал почти каждое нарушение обслуживания как «незначительное» в своём внутреннем журнале инцидентов, паттерн, показавшийся подозрительным новому директору по безопасности, учитывая постоянные, неформальные жалобы персонала на местах на серьёзные повторяющиеся проблемы. Расследование раскрыло, что классификация «незначительное» избегала обременительного формального процесса отчётности, требуемого для более высоких серьёзностей, создавая непреднамеренный стимул занижать классификацию. Агентство упростило свои формальные требования отчётности для всех серьёзностей и явно защитило персонал от обвинения за честное сообщение серьёзности, и последующие данные инцидентов показали более точную и существенно более высокую долю подлинно значимых нарушений, наконец дав руководству честную картину для приоритизации инфраструктурной инвестиции против.
Бизнес-кейс: мотивация, ROI и TCO
Отдача от подлинно безвиновных, хорошо классифицированных, разбитых по фазам метрик инцидентов это честные данные, фактически движущие системное улучшение, а не утешительная, но ложная картина, произведённая движимым страхом недосообщением или неправильной классификацией. Пример платёжной компании выше показывает это конкретно: культурное исправление, а не инвестиция в инструментарий, разрешило то, что руководство неправильно диагностировало как техническую проблему обнаружения.
Полная стоимость владения в основном культурная инвестиция и инвестиция процесса: устойчивая приверженность руководства безвиновной практике, задокументированные и проверенные аудитом критерии классификации серьёзности и дисциплина отслеживания пунктов действий разбора инцидента до завершения. Эта инвестиция стоит меньше, чем альтернатива, программа метрик инцидентов, уверенно производящая неправильные данные, потому что страх разрушил каждый вход в неё.
Антипаттерны и ловушки
- Обвинительно ориентированный пересмотр инцидента: разрушает честность сообщения, скорость подтверждения и классификацию серьёзности для каждого будущего инцидента.
- Отслеживание только смешанного числа времени реагирования: скрывает, какая конкретно фаза, обнаружение, подтверждение, решение, фактическая проблема.
- Непоследовательная классификация серьёзности между командами: делает общеорганизационные данные инцидентов ненадёжными для сравнения.
- Пересмотр частоты инцидентов и MTTR изолированно: упускает объединённую, честную картину, которую предоставляет парный сигнал.
- Процесс разбора инцидента, производящий понимание, но без завершённых пунктов действий: тратит впустую организационное обучение, которое процесс призван захватить.
- Заявленная безвиновная политика, которой фактически не живёт руководство: производит то же разрушение данных, движимое страхом, что и открыто обвинительная культура.
Модель зрелости
- Уровень 1, Инициация: Реагирование на инциденты неформально, сообщение непоследовательно, а обвинительная культура активно отговаривает от честного сообщения.
- Уровень 2, Развитие: Некоторое отслеживание инцидентов существует, но классификация серьёзности непоследовательна, а безвиновная практика заявлена, но непоследовательно соблюдается.
- Уровень 3, Стандартизация: Метрики инцидентов, разбитые по фазам, с последовательной, задокументированной классификацией серьёзности отслеживаются по всей организации, с подлинно безвиновной практикой разбора инцидента.
- Уровень 4, Управление: Частота инцидентов и MTTR пересматриваются вместе, пункты действий разбора инцидента отслеживаются до завершения, а классификация периодически проверяется аудитом на последовательность.
- Уровень 5, Оркестрация: Организация имеет продемонстрированный, устойчивый послужной список безвиновной практики, производящей честные данные и подлинные системные исправления, а метрики инцидентов напрямую и надёжно информируют решения об инвестиции в надёжность.
Идеи для обсуждения
- Выдержал бы наш процесс разбора инцидента честную проверку того, подлинно ли он безвиновный?
- Какова разбивка по фазам, обнаружение, подтверждение, решение, нашего самого медленного недавнего инцидента?
- Классифицировали бы две команды серьёзность нашего последнего значимого инцидента одинаково?
- Какой процент наших недавних пунктов действий разбора инцидента фактически был завершён?
- Формировал ли когда-либо страх обвинения то, как инцидент был сообщён или обсуждён в нашей команде?
Основные выводы
- Безвиновная культура разбора инцидента предпосылка для заслуживающих доверия данных инцидентов; страх обвинения разрушает и сообщение, и скорость подтверждения, и классификацию одинаково.
- Разбивайте время реагирования на фазы обнаружения, подтверждения и решения, каждая указывает на другое исправление.
- Классифицируйте серьёзность с последовательными, задокументированными, проверяемыми аудитом критериями, отражая дисциплину утёкших дефектов темы 5.1.
- Пересматривайте частоту инцидентов и MTTR вместе, никогда изолированно, ту же дисциплину сочетания, что метрики стабильности DORA.
- Отслеживайте пункты действий разбора инцидента до завершения; метрика побочный продукт хорошей практики, а не её цель.
Источники и дальнейшее чтение
- Site Reliability Engineering: How Google Runs Production Systems, под редакцией Бетси Бейер, Криса Джонса, Дженнифер Петофф и Найалла Ричарда Мёрфи (безвиновная практика разбора инцидента и метрики инцидентов).
- The Site Reliability Workbook, под редакцией Бетси Бейер, Найалла Ричарда Мёрфи, Дэвида К. Ренсина, Кента Кавахары и Стивена Торна (практическое руководство по реагированию на инциденты и разбору).
- The Field Guide to Understanding Human Error, Сидни Деккер (основополагающий кейс для системного, безвиновного расследования отказа).
- Allspaw, John, “Blameless PostMortems and a Just Culture,” Etsy Engineering Blog (2012): раннее, влиятельное формулирование безвиновной практики в эксплуатации программного обеспечения.