8.3 恐怖を生まずに指標を展開する
概要と動機
本トピックは、ある本物の意味で、トピック1.2がグッドハートの法則を導入して以来本書が論じてきたすべてのことの実用的な集大成です。信頼ではなく恐怖を引き起こす方法で悪く展開された指標プログラムは、個々の指標がどれだけ注意深く設計されていたかにかかわらず、その後のすべてのトピックが警告してきたまさにそのゲーミングの行動を保証します。組織は、正直な視覚化、ガードレールの組み合わせ、注意深いガバナンスなど、すべての技術的な詳細を正しく行うことができますが、それでも、もし展開そのものが、これらの数字がエンジニアを助けるためではなく彼らを判断するために存在すると教えるなら、汚染され信頼できない指標プログラムを生み出すことができます。
ここでのメカニズムは単純明快であり、本書全体で引用してきた組織行動の研究にわたって十分に文書化されています。指標が自分に不利に使われることを恐れる人々は、心理的安全性を損ない、まさにトピック1.2が予測する通りに反応します。彼らは根底にある現実ではなく数字を最適化します。自分自身を守るインセンティブは即座で個人的である一方で、組織的な学びへの害は拡散的で遅れるからです。これは個人の性格の失敗ではありません。それは本物の脅威への合理的な反応であり、唯一の持続的な修正は脅威を取り除くことであり、それにもかかわらず人々により正直に振る舞うよう求めることではありません。
大規模なチームにとって、本トピックの指針は、信頼がどちらの方向にもまだ確立されておらず、早期の印象が持続的な期待を設定する最初の展開の瞬間に最も鋭く重要です。新しい組織全体の指標プログラムを導入する企業組織は、一つのチームの指標が懲罰的に使われたという一つの不適切に処理された早期のインシデントが、展開全体にわたって信頼を毒するリスクを冒します。しばしば既存の組合の保護、公務員文化、あるいは測定の取り組みへの歴史的な不信という文脈の中で指標プログラムを導入する政府組織は、本トピックの指針を特別な配慮と忍耐をもって適用する必要があります。
重要な原則
- 恐怖は、指標の設計のどんな技術的な欠陥よりも速く徹底的にデータを汚染する。 完璧に設計された指標でも、悪く展開されればゲーミングされます。
- 信頼は、ポリシーの声明だけではなく、実証され一貫した非懲罰的な使用を通じて確立される。 複数のサイクルにわたる行動が信頼を築きます。言葉だけでは築きません。
- 早期の展開のインシデントは持続的な期待を設定する。 指標が重大なことに触れる最初の数回が、プログラム全体が今後どう認識されるかを決定します。
- 目的とプロセスについての透明性は、安心させることだけよりも恐怖を減らす。 人々は、告げられたことだけでなく、見て理解できることを信頼します。
- これは一度限りの展開の発表ではなく、持続的な組織の規律である。 本物に信頼できるスタートの後でさえ、恐怖は徐々に忍び込んで戻ってくることがあります。
推奨事項
懸念が生じた後ではなく、展開前に目的と非目標を明示的に伝える
トピック1.4の指標憲章の規律に従い、新しい指標プログラムの目的と、決定的にその明示的な非目標(別途明確に開示されたポリシーなしに個人のパフォーマンス評価には決して使われない、トピック1.1に従って)を、エンジニアが心配し始めた後に反応的にではなく、公開前に伝えてください。指標が何のためのものではないかについての積極的で事前の透明性は、そうでなければ空白を埋めて早期の逆転しにくい印象を形作る不安な憶測を防ぎます。
測定される人々を設計のプロセスに巻き込む
自分自身の仕事を記述する指標の設計を助けるエンジニアは、入力なしにシステムを課されたエンジニアよりも、その指標を恐れたり恨んだりする可能性がはるかに低くなります。どの指標を追跡するか、それがどう視覚化されるか、どのガードレールが適用されるかを選ぶことに、チームの代表者を直接巻き込んでください。これは純粋にトップダウンの命令ではなく、本書が一貫して強調するチームレベルの所有権(トピック1.4)に従ったものです。
診断専用の使用から始め、どんな評価的な使用でも検討される前に複数のサイクルにわたってそれを証明する
トピック1.1の診断的対評価的の区別に直接従ってください。新しい指標プログラムを純粋に診断的なモードで始め、システムを理解し改善するためだけに使い、個人あるいはチームの評価とはまったく接続せず、より広い使用についてのどんな会話でも始まる前に、その規律を複数の報告サイクルにわたって見える形で維持してください。時間をかけて実証された自制を通じてこの方法で築かれた信頼は、ポリシー文書だけを通じて主張された信頼よりもはるかに持続的です。
最初の不適切に処理されたインシデントに即座に見える形で対応する
もし指標が一度でも、非公式にであっても懲罰的に誤用されたら、それを静かに見過ごすのではなく、即座に見える形で直接対処してください。組織の最初の不適切な処理のインシデントへの対応は、今後のプログラム全体へのチームあるいは組織全体の信頼を形作る上で不釣り合いに重要です。速く透明な修正は、述べられた非懲罰的な目的への本物のコミットメントを示し、沈黙や静かで対処されない例外は、そもそもゲーミングの行動を駆動するまさにその恐怖を確認します。
ゲーミングのリスク自体を、隠されたマネジメントの懸念ではなく共有された透明な会話にする
ゲーミングのリスクをリーダーシップが私的に心配するものとして扱うのではなく、トピック1.2のガードレールの組み合わせのロジックを測定されるチームと公然と共有してください。特定のガードレールがなぜ存在するか、それがどのゲーミングのパターンを捕捉するよう設計されているかを直接説明し、ガードレールがよく設計されているかどうかについてチーム自身の意見を招いてください。この透明性は、チーム全体をゲーミングのために見張られている対象としてではなく、それを防ぐパートナーとして枠組みづけ、リスクについて一度も公然と話し合うことなく上からひっそりとゲーミングを取り締まるシステムとはまったく異なる関係を指標プログラムと築きます。
トレードオフ:長所と短所
| アプローチ | 長所 | 短所 |
|---|---|---|
| 最小限のチームの関与を伴うトップダウンの命令 | 展開が速く、一貫した設計 | 最初から恐怖主導のゲーミングと低い信頼の高いリスク |
| チームを巻き込んだ共同設計の展開 | 本物の信頼と賛同を築く、より低いゲーミングのリスク | 展開がより遅く、より多くの調整の努力が必要 |
| 初日からの即座の評価的な使用 | 効率的に感じられ、指標を結果に素早く結びつける | どんな信頼も確立される前に最大限の恐怖とゲーミングのリスクを引き起こす |
| どんな評価的な使用の前の延長された診断専用の証明期間 | 持続的で証拠に基づいた信頼を築く | リーダーシップが最終的に望むかもしれないどんな評価的な使用事例も実現するのがより遅い |
中心にある緊張関係は展開の速度と信頼の構築です。速いトップダウンの展開は指標プログラムを速く稼働させますが、本書が冒頭のトピックから警告してきたまさにその恐怖とゲーミングを引き起こす本物のリスクを伴います。より遅くチームを巻き込んだ診断優先の展開はより時間がかかりますが、結果として得られるデータをそもそも収集する価値のあるものにする持続的な信頼を築きます。この緊張を、信頼の構築に有利に断固として解消してください。速く起動するがゲーミングされた信頼できないデータを生み出す指標プログラムは、それがどれだけ速く展開されたとしても、ある本物の意味で、本書が論じてきたことを何も達成していないからです。
チームで話し合うべき問い
私たちの現在の指標プログラムの目的と明示的な非目標は展開前に伝えられたでしょうか、それともエンジニアはまずそれについて知り、それがどう使われるかについての安心はずっと後になってから聞いたでしょうか。 安心が積極的にではなく反応的に来たなら、その順序自体がすでに早期の信頼を否定的に形作っていたかもしれません。正直に名指しする価値があります。
測定される人々は自分自身の仕事を記述する指標の設計に巻き込まれたでしょうか、それともシステムは入力なしに課されたでしょうか。 結果として得られる指標の設計がどれだけうまくいったかにかかわらず、関与はそれ自体として重要であるため、この特定のテストに対してあなたの実際の展開のプロセスを評価してください。
私たちの指標プログラムは複数の報告サイクルにわたって本物に診断専用の使用を維持してきたでしょうか、それとも評価的な使用が信頼構築の展開が推奨するよりも早く忍び込んできたでしょうか。 実際の歴史を正直にたどってください。ここでの漂流は、しばしば単一の明示的なポリシーの変更を通じてではなく、段階的かつ非公式に起こります。
指標が一度でも、非公式にであっても懲罰的に誤用されたことがあるでしょうか、そして組織はどう対応したでしょうか。 これが起きたことがあるなら、その対応が速く見えるものだったか、それとも静かで対処されないものだったかを正直に評価してください。その対応は、元のインシデント自体よりもはるかにプログラム全体への信頼を形作ったからです。
測定されるチームはなぜ各ガードレールが存在するかを理解しているでしょうか、それともゲーミング防止のロジックは彼らが直接告げられることのない私的なマネジメントの懸念のままでしょうか。 あなたの組織のガードレールの理由(トピック1.2)が実際に透明に共有されてきたか、それとも述べられていない舞台裏の設計上の考慮事項のままであるかを話し合ってください。
もし今日私たちが指標の展開をゼロからやり直し、本トピックの指針を完全に適用するなら、そのプロセスは実際に起きたこととどれだけ違って見えるでしょうか。 この振り返りの思考実験は、しばしば、時間的なプレッシャーの下で信頼の構築が近道されてきた特定の名指し可能な場所を明らかにします。元の展開を元に戻せなくても、そこから学ぶ価値があります。
業種別の視点
スタートアップ。 信頼はこの規模ではしばしば確立しやすいです。直接の日々の会話が自然に本トピックが推奨する透明性を提供するからです。リスクは、小さく密接なチームでは不要に感じられるという単純な理由で、目的と非目標の意図的な伝達を省略することです。これは、チームが成長し、同じ共有された文脈なしに新しい採用者が加わるにつれて静かに崩れる可能性のある仮定です。
中小企業。 なぜ新しい指標が導入されているのか、それが何に使われ何に使われないのかについての単純で直接の会話を、懸念が表面化した後ではなく展開前に行うことは、この規模で正式なプロセスを必要とせずに本トピックの価値のほとんどを捕捉します。
企業。 大規模な組織の規模と非人格性は、本トピックの指針をうまく実行することをより難しくし、それを正しく行うことをより重要にします。一つの不適切に処理されたインシデントは、それを直接経験するのではなく又聞きする数十のチームにわたって信頼を毒する可能性があるからです。本トピックが推奨する延長された診断優先の証明期間に意図的に投資し、どんな指標誤用のインシデントが起きる前にも明確で速く見える対応のプロトコルを確立してください。
政府。 公共部門の組織は、しばしば既存の組合の保護、確立された公務員の文化、そして場合によっては過去のパフォーマンス管理の論争に結びついた測定の取り組みへの歴史的な不信という文脈に指標プログラムを導入します。本トピックの指針を特別な忍耐と形式性をもって適用し、設計のプロセスに組合あるいはスタッフの代表者の入力を直接巻き込む可能性を検討し、信頼構築のタイムラインが典型的な民間部門の文脈よりも本物に長くなることを予期してください。
事例
企業。 あるソフトウェア会社の包括的なエンジニアリング指標ダッシュボードの最初の展開は、チームレベルの入力なしに完全に中央のプラットフォームチームによって設計されており、広範で静かな抵抗に遭いました。組織全体のエンジニアは、不信を抱かれたトップダウンの指標システムについてトピック1.2が予測するとおり、数週間以内に自分たちの報告する数字を非公式にゲーミングし始めました。6ヶ月後の再始動は、今度は指標の選択とガードレールの設計にチームの代表者を直接巻き込み、より広い使用についてのどんな会話の前にも6ヶ月の診断専用の期間に明示的にコミットし、それを本物に維持しました。これは1年以内に測定可能により信頼できるデータを生み出しました。自己報告されたデプロイ件数とパイプラインで計測されたデプロイ件数を比較する内部監査は、元の展開の早期の数ヶ月と比較して、両者のギャップが実質的に縮小していたことを発見しました。
政府。 ある州政府機関のエンジニアリング指標の導入への最初の試みは、マネージャーがパフォーマンスの会話で個人の活動データを非公式に引用した単一のインシデントの後、2年前に完全に放棄されていました。これは孤立しているが対処されなかったインシデントであり、その後何年にもわたって機関全体で取り組み全体への信頼を毒し、スタッフは元のプログラムが静かに棚上げされた後もずっと「あの指標のこと」を目に見える懐疑をもって言及し続けていました。意図的に再始動された新しいプログラムは、この歴史に直接公に明示的に取り組み、過去の不適切な処理を認め、名前のついた責任あるエグゼクティブのスポンサーとともに特定の公開された非懲罰的使用のポリシーにコミットし、将来のどんな誤用の懸念にも速く透明な対応のプロトコルを確立しました。歴史が存在しないかのように単に再始動するのではなく、過去の失敗をこの明示的に認めることが、第一の試みが得られなかった本物の信頼を第二の試みが得た理由としてスタッフの代表者によって特に評価されました。
ビジネスケース:動機、ROI、総所有コスト
信頼を構築し恐怖を避ける展開からの見返りは、単純に信頼できるデータです。それなしには、本書の他のすべてのトピックの注意深い指標設計の仕事は本物の価値を何も生み出しません。上記の企業の例はこれを具体的かつ測定可能に示しています。再始動されたプログラムのデータは、元の恐怖主導の展開のデータよりも実証的に正確でした。これは追加の信頼構築の投資への直接的で定量化可能な見返りです。
総所有コストは主に時間と組織的な忍耐です。延長された診断優先の証明期間、設計におけるチームの関与の努力、そしてどんな誤用のインシデントにも速く見える形で対応する持続的な規律です。そのコストは重大ですが、本書の他のすべてのトピックが依存する信頼できるデータの必要で避けられない代価です。この投資を省略する速い展開は、完成しているように見えるが静かに無価値な指標プログラムを生み出し、本書の最初の実質的なトピックから警告してきたまさにそのゲーミングによって汚染されます。
アンチパターンと落とし穴
- 指標の設計にチームの関与がないトップダウンの展開。 指標自体がどれだけうまく設計されていたかにかかわらず、最初から恐怖とゲーミングを引き起こします。
- 目的と非目標の積極的ではなく反応的な伝達。 不安な憶測が空白を埋め、早期の逆転しにくい印象を形作ることを許します。
- 本物の診断専用の信頼期間が経過する前に評価的な使用に急ぐ。 新しい指標プログラムが即座にゲーミングの行動を引き起こす単一の最も一般的な方法です。
- 指標誤用のインシデントへの静かで対処されない対応。 ゲーミングを駆動するまさにその恐怖を確認し、プログラム全体への信頼に持続的な損害を与えます。
- ガードレールとゲーミング防止のロジックを私的なマネジメントの懸念のままにしておく。 測定されるチームとの透明で共有された理由づけの信頼構築の機会を逃します。
- 過去の失敗を直接認めることなく、以前不適切に処理された指標プログラムを再始動する。 不十分な透明性という元の間違いを繰り返し、今回は対処されない歴史によって複合します。
成熟度モデル
- レベル1、開始: 指標はチームの関与なしにトップダウンで展開されており、目的と非目標は、伝えられるとしても反応的に伝えられています。
- レベル2、発展: いくらかのコミュニケーションとチームの関与は起きますが、持続的な診断専用の証明期間も明確な誤用対応のプロトコルもありません。
- レベル3、標準化: 新しい指標プログラムは、積極的なコミュニケーション、設計におけるチームの関与、組織全体でのコミットされた診断専用の証明期間とともに一貫して展開されています。
- レベル4、管理: 速く透明でテスト済みの誤用対応のプロトコルが存在し実行されており、ガードレールの理由は測定されるチームと標準的な実践として公然と共有されています。
- レベル5、最適化: 組織は、規律あり信頼構築の展開の実践に直接帰属できる、信頼でき低ゲーミングの指標データの実証された持続的な実績を持ち、この実績は新しい指標が導入されるたびに積極的に保護され強化されています。
議論のためのアイデア
- 私たちの現在の指標プログラムの目的は懸念が生じる前か後かのどちらに伝えられたでしょうか。
- 測定される人々は私たちの指標の設計に本物に巻き込まれたでしょうか、それともシステムは課されたでしょうか。
- 私たちの組織は指標を懲罰的に不適切に処理したことがあるでしょうか、そして私たちはどう対応したでしょうか。
- 測定されるチームはなぜ私たちのガードレールが存在するかを理解しているでしょうか、それともその理由づけは私的なままでしょうか。
- もし今日私たちの指標プログラムを本トピックに完全に注意を払って再始動したら、私たちは何を違えてするでしょうか。
主な要点
- 恐怖は、指標の設計のどんな技術的な欠陥よりも速く徹底的にデータを汚染します。 完璧に設計された指標でも、悪く展開されればゲーミングされます。
- 測定されるチームを指標の設計に直接巻き込み、展開前に目的と明示的な非目標を積極的に伝えてください。
- どんな評価的な使用が検討される前にも、診断専用から始め、それを複数のサイクルにわたって証明してください。
- 最初の不適切に処理されたインシデントに即座に見える形で対応してください。 沈黙はゲーミングの行動を駆動するまさにその恐怖を確認します。
- 測定されるチームとガードレールとゲーミング防止の理由づけを透明に共有し、取り締まりの関係ではなくパートナーシップを築いてください。
参考文献とさらなる読書
- Drive: The Surprising Truth About What Motivates Us, Daniel H. Pink 著。
- The Tyranny of Metrics, Jerry Z. Muller 著。
- Site Reliability Engineering: How Google Runs Production Systems, Betsy Beyer、Chris Jones、Jennifer Petoff、Niall Richard Murphy 編。
- Accelerate: The Science of Lean Software and DevOps, Nicole Forsgren、Jez Humble、Gene Kim 著。