6.2 インシデントの指標:検知、対応、復旧
概要と動機
本トピックは、トピック6.1のエラーバジェットが実際の失敗を通じて使われたときに何が起きるかを測定します。インシデント、サービスを劣化させるか中断させる計画外のイベントです。四つの指標が、組織がこれをどれだけうまく処理するかを測定するための標準的な語彙を形成します。平均検知時間(MTTD)、組織が何かがおかしいと気づくまでにどれだけかかるか。平均確認時間(MTTA)、誰かが対応の所有権を引き受けるまでにどれだけかかるか。平均解決時間または復旧時間(MTTR)、サービスが復旧するまでにどれだけかかるか。これはトピック2.10がデプロイによって引き起こされた失敗について特にカバーした同じ概念で、原因にかかわらずあらゆるインシデントに一般化されたものです。そしてインシデントの頻度、単にインシデントがどれだけ頻繁に起きるかです。
トピック2.10の変更失敗率の扱いを反映する本トピックの中心的な懸念は、これらの数字が、インシデントを正直に報告し分類することを取り巻く組織文化と同じくらいしか信頼できないということです。インシデントについて非難を恐れるチームは、過小報告する、「時計の上にいる」ことを避けるために確認を遅らせる、あるいは自分たちの指標を守るために深刻な事象を軽微だと分類するあらゆるインセンティブを持ちます。Etsyのような組織で先駆けられGoogleのSREの文献で正式化された非難のない事後検証の実践は、特にそのインセンティブを取り除くために存在し、本トピックはそれを、指標の上に重ねられたオプションの文化的な心地よさではなく、信頼できるインシデントデータのための前提条件として扱います。
大規模なチームにとって、インシデントの指標は、組織の検知と対応の能力、とりわけトピック2.10のロールバックのツールへの投資が、そのトピックがカバーした特定のデプロイによって引き起こされた失敗のシナリオだけでなく、本物の多様な条件の下で実際に機能するかどうかを明らかにします。重要なインフラを運用する企業と政府の組織は、これらの指標に内部的には本物の運用の改善を推進するために、外部的には顧客、規制当局、あるいは公衆に対してインシデントが有能に処理され時間とともに改善していることを実証するために依存しています。
重要な原則
- 非難のない文化は信頼できるインシデントデータの前提条件であり、オプションの追加ではありません。非難への恐れは、報告、確認の速度、重大度の分類を同様に汚染します。
- 検知、確認、解決は、それぞれ異なる修正を持つ別個の段階である。 遅い全体的な復旧時間は、実際にどの段階が遅いかに応じて、まったく異なる根底にある問題を隠すことがあります。
- インシデントの頻度とMTTRは対になったシグナルであり、DORAの変更失敗率と復旧時間(トピック2.10)に似ています。どちらか一方だけでは全体の話を語りません。
- 重大度の分類は、エスケープした欠陥の分類(トピック5.1)と同じ厳密さを必要とする。 場当たり的な判断ではなく一貫した文書化された基準です。
- 事後検証の価値は、数字を生み出すことではなく体系的な学びにある。 指標は良い実践の副産物であり、その目標ではありません。
推奨事項
インシデント対応時間をその別個の段階に分解する
単一の混合された合計だけではなく、検知時間(失敗の実際の発生から誰かが気づくまで)、確認時間(通知から誰かが所有権を引き受けるまで)、解決時間(所有権から本物の復旧まで)を別々に測定し報告してください。各段階は異なる修正を指し示します。遅い検知は監視とアラートのギャップを指し示し、遅い確認はオンコールのプロセスやエスカレーションの問題を指し示し、遅い解決はツール、ランブック、あるいは診断能力のギャップを指し示します(トピック2.10はこれをデプロイによって引き起こされた失敗について特にカバーしています)。
本物に非難のない事後検証プロセスを構築し保護する
非難のない事後検証は、何が起きたか、そしてなぜシステムがそれが起きることを許したかを調査し、同じ状況で同じ情報を持つ合理的などんな人でももっともらしく犯していたであろう間違いについて個人に過失を帰属させることを明示的に避けます。この規律を積極的に保護してください。インシデントへの非懲罰的な対応をモデル化するリーダーシップ、明示的な書面によるポリシー、そして「誰がこれをしたか」ではなく「私たちのシステムの何がこれを許したか」と問う習慣は、すべて一度限りのポリシー声明ではなく、必要で継続的な投資です。
一貫した文書化され監査された基準で重大度を分類する
トピック5.1がエスケープした欠陥について推奨する同じ規律をインシデントの重大度の分類に適用してください。実際の顧客あるいはビジネスへの影響に基づいた固定された文書化された尺度を、チーム間で一貫して適用し、定期的に漂流について監査します。一貫性のない分類(あるチームは寛大で、あるチームは厳格)は、一貫性のない分類をされた欠陥データと同じくらい、組織全体のインシデントデータを比較のために信頼できないものにします。
インシデントの頻度とMTTRを一緒に追跡し、決して孤立させない
改善しているMTTRと上昇しているインシデントの頻度は、チームが火消しがうまくなっている一方で、根底にあるシステムの信頼性が実際には劣化していることを示しているかもしれません。低下しているインシデントの頻度と悪化しているMTTRは、頻繁な軽微なものに取って代わる、まれだがより深刻で診断がより難しい失敗を示しているかもしれません。第2部のDORA指標の速度と安定性の組み合わせの規律を正確に反映して、両方を一緒に見直し、正直な組み合わされた全体像を得てください。
事後検証から単なる指標だけでなく体系的なアクションアイテムを抽出し追跡する
事後検証のプロセスの本物の価値は、それが生み出す特定の体系的なアクションアイテムです。欠けていたアラートが追加される、ランブックが改善される、単一障害点が取り除かれるなどです。これらのアクションアイテムを、トピック4.5の技術的負債バックログと同じ規律で完了まで追跡してください。なぜなら、洞察を生み出すがフォローアップのない事後検証は、そのプロセスが捕捉することを意図している組織的な学びを無駄にするからです。
トレードオフ:長所と短所
| アプローチ | 長所 | 短所 |
|---|---|---|
| 混合された単一のインシデント対応時間の指標 | 報告が単純 | どの特定の段階(検知、確認、解決)が実際の問題であるかを隠す |
| 段階に分解されたインシデントの指標 | 診断的で、直接正しい修正を指し示す | 各段階の遷移のより注意深い計測が必要 |
| 非難志向のインシデントレビュー | 責任を感じさせ、責任を割り当てたいという欲求を満たす | 将来の報告の正直さを汚染し、めったに実際の体系的な原因を修正しない |
| 非難のない事後検証の実践 | 正直なデータと本物の体系的な修正を生み出す | 維持するために持続的な文化的投資とリーダーシップの規律が必要 |
中心にある緊張関係は個人の説明責任の魅力と正直な報告の実用的な必要性です。インシデントの後に個人を非難することは満足感を感じさせ、決断力のあるリーダーシップのように見えることがありますが、それは確実にすべての将来のインシデントのデータを汚染します。なぜなら、人々は個人的な結果を恐れるようになると、過小報告したり、確認を遅らせたり、重大度を誤分類したりするからです。この緊張を意図的かつ一貫して非難のない実践に有利に解消し、本物の説明責任は、たまたまそれが起きたときに居合わせた個人を罰することからではなく、失敗を許したシステムを修正することから来ることを理解してください。
チームで話し合うべき問い
私たちはインシデント対応時間を検知、確認、解決の段階に分解しているでしょうか、それとも単一の混合された数字だけを追跡しているでしょうか。 混合された数字だけが存在するなら、最近の重要なインシデントを一つ選び、それが何を明らかにしていたかを見るために、遡って段階の内訳を再構築してみてください。
私たちのチームは、私たちの事後検証プロセスが本物に非難のないものであると本物に信じているでしょうか、それとも結果への恐れが依然としてインシデントがどう報告され話し合われるかを形作っているでしょうか。 これを直接正直に尋ねてください。述べられた非難のないポリシーが実際には実践されていないなら、信頼できるデータを生み出しません。
二つの異なるチームは同じインシデントの重大度を同じように分類するでしょうか。 実際の過去の曖昧なインシデントを一つ選び、異なるチームの代表者に独立してそれを分類してもらい、結果を比較してください。
私たちはインシデントの頻度とMTTRを一緒に見直しているでしょうか、それとも一方がもう一方よりも多くの注目を集めているでしょうか。 この組み合わせについての実際の報告の実践とレビューを確認してください。トピック2.10がDORAの安定性の指標について推奨する同じ規律を反映しています。
過去6ヶ月の私たちの事後検証のアクションアイテムのうち実際に完了した割合はどれくらいでしょうか。 現在これを追跡していないなら、そのギャップは名指しする価値があります。低いアクションアイテムの完了率を持つ事後検証のプロセスは、フォローアップなしに洞察を生み出しています。
非難への恐れが、誰かがインシデントの報告や確認を遅らせる原因になったことがあるでしょうか。 これは不快だが重要な問いです。正直な「はい、そしてこれが起きたことです」という答えは、反射的な「いいえ」よりも、あなたのインシデントプロセスの健全性にとってはるかに価値があります。
業種別の視点
スタートアップ。 インシデント対応は、小さなチームでは必然的にしばしば非公式であり、正式な段階の分解は最初は不要かもしれません。早期に身につける価値のある習慣は、最初のインシデントから非難のない議論の規範です。早期に設定された文化的な習慣は、非難を招きやすいパターンが定着した後に改修するよりもはるかに維持しやすいからです。
中小企業。 基本的な重大度の分類と重要なことについての簡潔な非難のない振り返りを伴う、非公式であっても単純な共有されたインシデントのログは、洗練されたツールや専任のインシデント管理プラットフォームを必要とせずに、本トピックの価値のほとんどを捕捉します。
企業。 一貫した重大度の分類と本物の持続的な非難のない文化は、どちらも規模が大きくなるとより維持が難しくなり、どちらも数十のチームにわたる信頼できる比較可能なインシデントデータに不可欠です。文書化された分類基準、定期的な監査、非難のない対応の積極的なリーダーシップのモデル化に投資してください。非難への文化的な漂流は、意図的で継続的な対抗圧力なしに徐々に忍び寄る傾向があるからです。
政府。 公共サービスや重要なインフラに影響を与えるインシデントは、しばしば外部の精査、メディアの注目、あるいは正式な調査に直面し、これは積極的に管理されなければ内部の非難のない実践を直接損なう可能性のある非難を求める強いプレッシャーを生み出します。深刻なインシデントの後に続くかもしれないどのような外部の説明責任プロセスとも分離された、本物の体系的な学びのための明確な内部の非難のない規律を維持し、その区別をスタッフに明確に伝えてください。
事例
企業。 ある決済会社のエンジニアリング文化は、何年もの間、責任があるように見えることを避けるために素早く確認することを最小化すべきものとして非公式にインシデントを扱っており、これはリーダーシップが当初不十分な監視ツールに起因すると考えていた一貫して悪い検知と確認の時間を導いていました。本物に非難のない事後検証に向けた文化的な転換は、リーダーシップが速い解決だけを称賛するのではなく、速く正直なインシデントの確認を公にかつ具体的に称賛することを含み、2四半期以内に検知時間と確認時間の両方で測定可能な改善を生み出し、元のボトルネックが、当初想定されていた技術的な不十分なツールではなく、文化的な非難への恐れであったことを明らかにしました。
政府。 ある公共交通機関の運用センターは、歴史的に、その内部のインシデントログでほぼすべてのサービスの中断を「軽微」として分類しており、これは新しい安全担当責任者が、深刻な繰り返される問題についての現場スタッフからの根強い非公式の苦情を考慮すると疑わしいと感じたパターンでした。調査は、「軽微」という分類が、より高い重大度に必要な負担の大きい正式な報告プロセスを回避していたことを明らかにし、意図しない過小分類のインセンティブを作っていました。機関はすべての重大度についての正式な報告要件を簡素化し、正直な重大度の報告について非難からスタッフを明示的に保護し、その後のインシデントデータは、本物に重要な中断のより正確で実質的に高い割合を示し、ついにリーダーシップに、それに対してインフラ投資を優先順位づけるための正直な全体像を与えました。
ビジネスケース:動機、ROI、総所有コスト
本物に非難のない、よく分類された、段階に分解されたインシデントの指標からの見返りは、恐怖主導の過小報告や誤分類によって生み出される心地よいが誤った全体像ではなく、実際に体系的な改善を推進する正直なデータです。上記の決済会社の例はこれを具体的に示しています。ツールへの投資ではなく文化的な修正が、リーダーシップが技術的な検知の問題と誤診していたものを解決しました。
総所有コストは主に文化とプロセスへの投資です。非難のない実践への持続的なリーダーシップのコミットメント、文書化され監査された重大度の分類基準、そして事後検証のアクションアイテムを完了まで追跡する規律です。その投資は代替案(恐怖がすべての入力を汚染したために自信を持って間違ったデータを生み出すインシデント指標プログラム)よりもコストがかかりません。
アンチパターンと落とし穴
- 非難志向のインシデントレビュー。 報告の正直さ、確認の速度、重大度の分類を、すべての将来のインシデントについて汚染します。
- 混合された対応時間の数字だけを追跡する。 どの特定の段階(検知、確認、解決)が実際の問題であるかを隠します。
- チーム間で一貫性のない重大度の分類。 組織全体のインシデントデータを比較のために信頼できないものにします。
- インシデントの頻度とMTTRを孤立して見直す。 対になったシグナルが提供する組み合わされた正直な全体像を見逃します。
- 洞察を生み出すが完了したアクションアイテムがない事後検証のプロセス。 そのプロセスが捕捉することを意図している組織的な学びを無駄にします。
- リーダーシップによって実際には実践されていない述べられた非難のないポリシー。 公然と非難志向の文化と同じ恐怖主導のデータの汚染を生み出します。
成熟度モデル
- レベル1、開始: インシデント対応は非公式で、報告は一貫性がなく、非難を招きやすい文化が正直な報告を積極的に阻害しています。
- レベル2、発展: いくつかのインシデント追跡が存在しますが、重大度の分類は一貫性がなく、非難のない実践は述べられているが一貫して実践されていません。
- レベル3、標準化: 一貫した文書化された重大度の分類を伴う段階に分解されたインシデントの指標が、本物に非難のない事後検証の実践とともに組織全体で追跡されています。
- レベル4、管理: インシデントの頻度とMTTRは一緒に見直され、事後検証のアクションアイテムは完了まで追跡され、分類は一貫性のために定期的に監査されています。
- レベル5、最適化: 組織は、正直なデータと本物の体系的な修正を生み出す非難のない実践の実証された持続的な実績を持ち、インシデントの指標は直接的かつ信頼できる形で信頼性への投資の決定に情報を与えています。
議論のためのアイデア
- 私たちの事後検証のプロセスは、それが本物に非難のないものであるかどうかの正直なテストを生き延びるでしょうか。
- 私たちの最近の最も遅いインシデントの段階の内訳(検知、確認、解決)は何でしょうか。
- 二つのチームは私たちの最後の重要なインシデントの重大度を同じように分類するでしょうか。
- 私たちの最近の事後検証のアクションアイテムのうち実際に完了した割合はどれくらいでしょうか。
- 非難への恐れが、私たちのチームでインシデントがどう報告され話し合われたかを形作ったことがあるでしょうか。
主な要点
- 非難のない事後検証の文化は前提条件です。 信頼できるインシデントデータのためで、非難への恐れは報告、確認の速度、分類を同様に汚染します。
- 対応時間を検知、確認、解決の段階に分解してください。それぞれ異なる修正を指し示します。
- 一貫した文書化され監査された基準で重大度を分類してください。トピック5.1のエスケープした欠陥の規律を反映しています。
- インシデントの頻度とMTTRを一緒に見直してください。 孤立してではなく、DORAの安定性の指標と同じ組み合わせの規律です。
- 事後検証のアクションアイテムを完了まで追跡してください。 指標は良い実践の副産物であり、その目標ではありません。
参考文献とさらなる読書
- Site Reliability Engineering: How Google Runs Production Systems, Betsy Beyer、Chris Jones、Jennifer Petoff、Niall Richard Murphy 編。
- The Site Reliability Workbook, Betsy Beyer、Niall Richard Murphy、David K. Rensin、Kent Kawahara、Stephen Thorne 編。
- The Field Guide to Understanding Human Error, Sidney Dekker 著。
- Allspaw, John, “Blameless PostMortems and a Just Culture,” Etsy Engineering Blog (2012年)。