3.7 開発者体験の調査とDevEx指標
概要と動機
本トピックは、前のすべてのトピックの自己申告データを信頼できるものにする実践的な仕組みで第3部を締めくくります。人気投票ではなく本物の信号を生み出す開発者体験(DevEx)調査をどう設計するか、そして調査データを客観的な計測基盤と組み合わせて、組織が実際に行動できる指標群にどうするかです。このパートのあらゆるトピックは何らかの形の自己申告に依存しており、満足度と幸福感(トピック3.2)が最も直接的ですが、パフォーマンス、コミュニケーション、フローもすべて、よく設計された調査から利益を得ます。そして悪く設計された調査は、それらすべての価値を一度に損ないます。
開発者体験(DevEx)は、SPACEが形式化したのと同じ核心的な考えの周りに現れた、より広く、より最近の枠組みです。エンジニアの実際の日々の仕事をこなす体験、摩擦、ツール、認知的負荷、フィードバックのループは、それ自体が測定可能で改善可能なものであり、単なる柔らかい文化的関心事ではありません。DevExの研究、特にアビ・ノダ、マーガレット=アン・ストーリー、ニコール・フォーグレン、ミカエラ・グライラーによって提案されたフレームワークは、この体験をフィードバックのループ、認知的負荷、フロー状態という三つの次元の周りに組織化しており、これらはこのパートがすでに深く扱ってきたSPACEの次元に密接に対応し、それを拡張します。
大規模なチームにとって、信頼できる信号を生み出す調査と、ノイズを、あるいはもっと悪いことに積極的に誤解を招くデータを生み出す調査との違いは、本トピックが扱う設計の詳細に完全に宿っています。質問の言い回し、回答尺度の選択、サンプリングと頻度、そして結果が回答者にどう伝え返されるかです。何千人ものエンジニアにわたってこうした調査を大規模に実施する企業や政府の組織は、これを間違える余裕がありません。なぜなら、その規模での欠陥のある道具は、本物の資源配分の決定を形づくる自信ありげだが間違った結論を生み出すからです。
重要な原則
- 調査設計の質は、調査の長さや洗練さよりもはるかにデータの信頼性を決定する。 短くよく設計された調査は、長く悪く設計された調査に毎回勝ります。
- 回答率はそれ自体が信号である。 単なるデータ収集の指標ではありません。低下する回答率は、しばしばプロセスへの信頼の侵食を示します。
- 可能な場所ではどこでも調査データを客観的な計測基盤と組み合わせてください。 トピック1.5の計測基盤の原則に従い、客観的なデータが捉えられないものにこそ調査データを特に使ってください。
- 回答者とのループを閉じてください。 目に見える形でいかなる変化にもつながらない調査は、人々にそれを真剣に受け止めるのをやめるよう訓練します。
- DevExとSPACEは、選ぶべき競合するフレームワークではなく、同じ根底の関心事についての補完的な枠組みです。
推奨事項
明確さのために質問を設計し、誘導的あるいは二重の言い回しを避ける
質問そのものに想定を埋め込むことなく、平易な言葉で、正確に一つのことだけを尋ねる調査の質問を書いてください。「私たちのツールと文書化にどれだけ満足していますか」は、二つの潜在的に非常に異なる答えを一つの混乱した回答に混ぜ合わせる二重質問です。それを二つの別々の質問に分けてください。「ツールへの最近の投資はあなたの体験をどれだけ改善しましたか」のような誘導的な言い回しは避けてください。これは、それが中立的に起きたかどうかを尋ねるのではなく、改善が起きたことを前提としています。
一貫した回答尺度を使い、広く展開する前に新しい質問を試験する
あなたの調査の道具全体にわたって一貫した回答尺度(5段階あるいは7段階のリッカート尺度が一般的でよく研究されています)を標準化し、回答が質問間と時間を通じて比較可能であるようにしてください。組織全体に展開する前に、新しい質問は小さなグループで試験し、それが完全なデータセットを腐敗させる前に、曖昧な言い回しや予期しない解釈を捉えてください。
回答率をそれ自体の権利における診断的な信号として扱う
連続する調査サイクルにわたって調査の回答率を追跡し、低下する率を、トピック3.2で議論された信頼の信号に似た、直接調査する価値のある警告の兆候として扱ってください。低下する回答率は、しばしば調査疲れ、結果が行動につながるという信頼の侵食、あるいは匿名性が本物には保護されていないという高まる疑いを示しています。これらのどれも、単なるデータ収集の不便として退けられるのではなく、直接の調査に値します。
調査データを客観的なDevExの計測基盤と組み合わせる
存在する場所では、主観的な調査の回答を客観的な信号、ビルド時間、テストスイートの実行時間、ローカル開発環境のセットアップ時間、そしてトピック3.6のフロータイムと中断のデータと対にしてください。「私たちのビルドは遅すぎる」という調査の回答は、実際に測定されたビルド時間の傾向と対になると、はるかに行動可能になります。そしてその組み合わせは、知覚と客観的な現実がどちらの方向にも乖離するケースを捉え、それ自体が調査する価値があります。
ループを閉じる:結果と目に見える追跡行動を公開する
すべての調査サイクルの後、経営陣が強調したくないかもしれない結果を含め、結果の正直な要約を公開し、それに応じて取られた少なくとも一つの具体的な行動に公に約束してください。目に見える追跡が何も生まれない調査は、回答者に、自分たちの正直な入力が重要ではないと教え、これはその後のすべてのサイクルで回答率と回答の正直さの両方を低下させます。このループを閉じる規律は、しばしば、DevExの調査プログラムが複数年にわたって有用であり続けるか、それとも形だけの演習へとゆっくりと腐敗していくかの単一最大の決定要因です。
トレードオフ:長所と短所
| アプローチ | 長所 | 短所 |
|---|---|---|
| 長く包括的な調査 | 多くのトピックにわたる豊かで詳細なデータ | 低い回答率、より高い疲労、悪く設計された質問のより多くの余地 |
| 短く焦点を絞った調査 | より高い回答率、よく設計しやすい | カバレッジが少ない。選ばれた焦点の外で生じる問題を見逃す可能性がある |
| 調査データのみ | 主観的な経験を直接捉える | バイアスに脆弱で、客観的な現実と照らし合わせて検証できない |
| 客観的な計測基盤と組み合わせた調査 | 知覚と現実の間の乖離を捉え、より行動可能 | より多くのデータ統合の労力が必要 |
中心にある緊張関係は網羅性と回答の質です。より長く包括的な調査はより多くの領域を捉えますが、回答率を低下させ、悪く設計された質問がすり抜けるリスクを高めます。短く焦点を絞った調査はより質の高い回答を得ますが、その範囲の外にある重要な何かを見逃すリスクがあります。この緊張を解消するには、毎回のサイクルですべてを網羅しようとするのではなく、核心的で繰り返される調査を短く、よく試験されたものに保ち、より詳細な調査を必要とする特定のトピックには時折の明確にラベル付けされた深掘り調査を使ってください。
チームで話し合うべき問い
私たちは広く展開する前に、新しい調査の質問を小さなグループで試験したことがあるでしょうか。それとも新しい質問は完全な調査にそのまま行くでしょうか。 試験のステップを省くことは、曖昧な、あるいは二重の質問が、誰かが言い回しが不明確だったと気づく前に完全なデータセットを腐敗させてしまう、よくある方法です。
過去数回の調査サイクルにわたって私たちの回答率はどうなっており、もし低下が起きたなら、私たちはそれを調査したでしょうか。 この傾向を、ついでに記すべき単なるデータ収集の厄介ごとではなく、議論する価値のある本物の信号として扱ってください。
私たちは調査データを何らかの客観的な計測基盤と組み合わせているでしょうか。それとも私たちの報告では主観的な知覚が完全に独立して立っているでしょうか。 調査の質問を客観的なデータ、ビルド時間、デプロイ頻度と対にすることで結果をより行動可能にできる、少なくとも一つの場所を特定してください。
私たちの最後の調査サイクルの直接的で目に見える結果として、私たちはどんな具体的な行動を取り、その行動を回答者に伝え返したでしょうか。 正直な答えが「目に見えるものは何もない」なら、その隙間は、回答率にまだ表れていようがいまいが、おそらくすでにこの道具への信頼を蝕んでいます。
私たちの現在の調査の質問のどれかは誘導的あるいは二重のものでしょうか。そしてもしそうなら、私たちはそれに気づくでしょうか。 グループの演習として、あなたの実際の現在の質問をこの特定のテストと照らし合わせてレビューしてください。
私たちのDevExあるいはSPACEの調査データは、両者が不一致に見えるとき、客観的な信号とどう比較され、その不一致は私たちに何を教えてくれるでしょうか。 知覚と客観的なデータが乖離するケースは、しばしば両者が一致するケースよりも診断的に価値があります。なぜなら、その隙間自体が情報を与えるからです。
業種別の視点
スタートアップ。 シンプルで非常に短いパルス調査、時には一つか二つの質問だけで、非公式に頻繁に実施されるものは、この規模では通常十分であり、創業者がまだほぼ全員と定期的に直接会話できるとき、正式な道具設計の厳密さはあまり重要ではありません。
中小企業。 短く適応された質問群を使って四半期ごとに実施される無料か低コストの調査ツールは、専任の調査設計の専門知識を必要とせずに、ここでの価値のほとんどを捉えます。洗練さよりもループを閉じる規律を優先してください。小さなチームでさえ、短い調査が明らかにすることに目に見える形で行動することから利益を得ます。
企業。 調査設計の質は規模において非常に重要です。なぜなら、欠陥のある質問や壊れた匿名性の保証は、何千人もの回答者にわたって一度にデータを腐敗させ、結果として生じる自信ありげだが間違った結論は、重要な資源配分の決定を誤導することがあるからです。社内で場当たり的な道具を構築するのではなく、本物の調査設計の専門知識に投資するか、確立されたDevEx測定プラットフォームと提携してください。
政府。 回答率と信頼は、職員がすでに社内でデータがどう使われるかについて警戒しているかもしれない組織において特に脆弱です。データ利用についての懐疑が典型的な民間部門の環境よりすでに高いかもしれない文脈で、正直な回答率を達成可能にする信頼を築くために、透明な匿名性の保証と目に見える追跡行動に特に過剰投資してください。
事例
企業。 あるソフトウェア企業の最初のDevEx調査には、エンジニアに「ツールとプロセスへの満足度」を評価するよう求める質問が含まれていました。これは二つの非常に異なる関心事を混ぜ合わせた二重質問でした。混ぜ合わせられたスコアが平凡なものとして返ってきたとき、経営陣は問題がツールなのかプロセスなのか、あるいは両方なのかを見分けることができず、最初の是正の取り組みは2四半期にわたって間違った領域を狙いました。その後の改訂で質問を分割したところ、ツールのスコアは実際には強く、プロセスのスコアが悪いことが明らかになり、投資は煩雑なリリース承認プロセスを簡素化する方向へと方向転換され、これは1四半期以内に測定可能な満足度の改善を生み出しました。これは、ほとんど効果を示さなかった以前のツールに焦点を当てた取り組みとは対照的です。
政府。 ある国家デジタル機関の最初のDevEx調査は回答率が30%未満であり、社内レビューは、集計結果は匿名であるはずだったにもかかわらず、職員が広く、結果的に正しく、個々のマネージャーが誰が回答し誰が回答しなかったかを見られると信じていたことを発見しました。この機関は、検証された匿名性を持つ本物に独立した第三者の調査プラットフォームに移行し、その変更を明示的に繰り返し伝え、前回のサイクルの結果の明確な要約を、それに応じて取られた三つの具体的な行動とともに公開しました。回答率は2サイクル以内に70%を超えて上昇し、この機関の指導層は、本物の匿名性と目に見える追跡行動の組み合わせを、道具への信頼が回復した理由として特に評価しました。
ビジネスケース:動機、ROI、総所有コスト
よく設計されたDevExの調査プログラムからの見返りは、それが離職や提供の鈍化として表面化するまで見えないままになる次元、開発者体験についての信頼できる行動可能なデータです。上記のソフトウェア企業の例は、設計を間違えることのコストを示しています。単一の悪く言い回しされた質問が二つの別個の関心事を混ぜ合わせたために、2四半期分の誤導された是正の努力が費やされたのです。
総所有コストには、調査のツール、本トピックが推奨する設計と試験の規律、そして毎回のサイクルで目に見える追跡行動でループを閉じる継続的なコミットメントが含まれます。そのコミットメントは、どんなツールのコストよりも、調査プログラムが何年も有用であり続けるか、それとも時間とともに着実に信頼性の低いデータを生み出す形だけの演習へと腐敗していくかを決定するものです。
アンチパターンと落とし穴
- 二重あるいは誘導的な質問。 別個の関心事を混ぜ合わせるか回答に偏りを与え、試験なしではしばしば検出されません。
- 新しい質問のために試験のステップを省く。 曖昧な言い回しが完全な規模のデータセットを腐敗させるのを許します。
- 低下する回答率を無視する。 それ自体の権利における重要な信頼の信号を見逃します。
- 目に見える追跡行動で一度もループを閉じない。 回答者に、正直な入力は重要ではないと訓練し、将来のデータの質を低下させます。
- 客観的な裏づけなしに調査データをそれ自体で十分なものとして扱う。 知覚と現実がどちらの方向にも乖離するケースを見逃します。
- 弱い、あるいは検証不可能な匿名性の保証。 回答率と回答の正直さの両方を崩壊させる唯一最速の方法です。
成熟度モデル
- レベル1、開始: 調査の質問は場当たり的で試験されておらず、回答率は信号として追跡されておらず、結果はめったに目に見える行動につながりません。
- レベル2、発展: いくらかの調査設計の規律は存在しますが、試験は一貫しておらず、回答者とのループは確実には閉じられていません。
- レベル3、標準化: 質問は展開前に試験され、回答率は追跡され低下したときに調査され、結果は少なくとも一つの具体的な追跡行動とともに一貫して公開されています。
- レベル4、管理: 調査データは客観的な計測基盤と体系的に組み合わされ、両者の間の乖離が診断的な信号として能動的に調査されます。
- レベル5、最適化: 組織は、一貫して高い回答率、すべてのサイクルからの実証可能な目に見える行動、そしてデータを腐敗させる前に悪く設計された質問を捉え修正する実績を伴う、成熟し信頼される複数年の調査プログラムを持っています。
議論のためのアイデア
- 私たちの道具における現在の調査の質問のどれかが、回答者を混乱させたり誤導したりしたことがあるでしょうか。
- 調査データの直接的な結果として私たちが取った最後の具体的な行動は何だったでしょうか。
- もし私たちの匿名性の保証が、たとえ偶然にでも破られていたら、私たちはどうやってそれに気づくでしょうか。
- 私たちの調査データは、客観的な計測基盤とどこで一致し、あるいは不一致で、それは私たちに何を教えてくれるでしょうか。
- 私たちの現在の回答率を倍にするには何が必要でしょうか。
主な要点
- 調査の設計の質、明確で単一の概念を持つ偏りのない質問は、長さや洗練さよりも重要です。
- 回答率はそれ自体の権利における信号です。 単なる不便として扱うのではなく、低下を調査してください。
- 知覚と現実の間の乖離を捉えるために調査データを客観的な計測基盤と組み合わせてください。
- ループを閉じてください。 毎回のサイクルで結果と目に見える追跡行動を公開してください。さもなければ、道具への信頼は蝕まれます。
- DevExとSPACEは、開発者体験についての同じ根底の関心事の、競合するのではなく補完的な枠組みです。
参考文献とさらなる読書
- Noda, Abi, Margaret-Anne Storey, Nicole Forsgren, and Michaela Greiler, “DevEx: What Actually Drives Productivity,” ACM Queue (2023)。
- Forsgren, Nicole, Margaret-Anne Storey, Chandra Maddila, Thomas Zimmermann, Brian Houck, and Jenna Butler, “The SPACE of Developer Productivity,” ACM Queue (2021)。
- Ask Your Developer: How to Harness the Power of Software Developers and Win in the 21st Century, Jeff Lawson 著。
- Designing and Conducting Survey Research: A Comprehensive Guide, Louis M. Rea、Richard A. Parker 著。