8.3

8.3 推行指标而不滋生恐惧

概述与动机

从真正的意义上说,本主题是自主题 1.2 引入古德哈特定律以来,本书一直在论证的一切的实践高潮:一套推行得糟糕的指标项目,以一种激起恐惧而不是信任的方式推行,会保证恰恰是随后每个主题所警告的那种操纵行为,无论每一项具体指标被设计得多么细致。一个组织可以把每一个技术细节都做对,诚实的可视化、护栏配对、细致的治理,却依然可能产生一套腐败、不可信的指标项目,只要推行本身教会了工程师这些数字的存在是为了评判他们,而不是为了帮助他们。

这里的机制是直接的,在本书自始至终引用的组织行为研究中有充分的记录:害怕一项指标会被用来对付自己、从而损害心理安全感的人,会恰恰按主题 1.2 所预测的方式做出反应,他们优化的是这个数字,而不是底层的现实,因为保护自己的激励是即时、个人的,而对组织学习的损害是弥散、延迟的。这不是个人品格的失败;这是对一种真实威胁的理性反应,而唯一持久的解决办法,是消除这种威胁,而不是要求人们尽管面对威胁也要表现得更诚实。

对大团队而言,本主题的指导在初次推行时最为紧迫,那时信任尚未朝任何一个方向建立起来,而早期印象会确立起持久的预期。引入一套新的、全组织范围指标项目的企业组织,冒着单一一次处理不当的早期事件,也就是一个团队的指标被惩罚性地使用,就毒化整个推行的信任的风险;常常在既有工会保护、公务员文化,或对测量举措存在历史性不信任的背景下引入指标项目的政府组织,需要以格外的谨慎和耐心应用本主题的指导。

核心原则

  • 恐惧腐蚀数据的速度和彻底程度,超过指标设计中的任何技术缺陷。 一项完美设计、却推行得糟糕的指标,依然会被操纵。
  • 信任是通过被证明的、一贯的非惩罚性使用来建立的,而不仅仅是通过一份政策声明。 多个周期中的行动建立信任;单靠言辞不能。
  • 早期推行中的事件,会确立持久的预期。 一项指标最初几次触及一些有后果的事情的方式,决定了整个项目此后将如何被感知。
  • 对目的和流程的透明度,比单纯的安抚更能减少恐惧。 人们信任的是他们能看到、能理解的东西,而不只是被告知的东西。
  • 这是一种持续的组织纪律,而不是一次性的推行公告。 即使在一个真正值得信赖的开端之后,恐惧也可能逐渐悄悄渗回来。

建议

在推行之前,而不是在担忧出现之后,明确传达目的和非目标

遵循主题 1.4 的指标章程纪律,在推出之前,而不是在工程师已经开始担忧之后才被动地传达,就要传达一套新指标项目的目的,以及关键的一点,它明确的非目标(依据主题 1.1,除非另有清晰披露的政策,否则绝不用于个人绩效评估)。关于一项指标不用于什么的主动、事先的透明度,防止了那种否则会填满真空、塑造出难以逆转的早期印象的焦虑猜测。

让被测量的人参与设计流程

帮助设计那些将描述自己工作的指标的工程师,远比那些在没有任何发言权的情况下被强加了一套系统的工程师,更不容易害怕或怨恨这些指标。直接让团队代表参与选择要跟踪哪些指标、它们如何被可视化,以及适用什么护栏,遵循本书自始至终对团队层面所有权(主题 1.4)的一贯强调,而不是一种纯粹自上而下的强制命令。

从纯粹的诊断性使用开始,并在考虑任何评价性使用之前,用多个周期证明它

直接遵循主题 1.1 诊断性与评价性的区分:以纯粹诊断模式启动一套新的指标项目,只用于理解和改善系统,与个人或团队评估完全没有任何联系,并在开始任何关于更广泛使用的对话之前,可见地在数个报告周期中维持这项纪律。以这种方式建立的信任,通过随时间推移被证明的克制建立起来的信任,远比单靠一份政策文件所宣称的信任更持久。

立即、可见地回应第一起处理不当的事件

如果一项指标被惩罚性地滥用,哪怕只有一次,哪怕只是非正式地,也要立即、可见、直接地处理它,而不要让它悄悄过去。一个组织对其第一起处理不当事件的回应,在塑造整个团队或组织对整个项目未来的信任方面,具有不成比例的重要性;一次快速、透明的纠正,传递出对所声明的非惩罚性目的的真正承诺,而沉默或一次悄悄未被处理的例外,则恰恰证实了最初驱使操纵行为的那种恐惧。

让操纵风险本身成为一场共享、透明的对话,而不是一个隐藏的管理关切

不要把操纵风险当作领导层私下担忧的东西来对待,而要向被测量的团队开放地分享主题 1.2 的护栏配对逻辑:直接解释一个具体护栏为什么存在,它是设计用来捕捉哪种操纵模式,并邀请团队自己就这个护栏是否设计良好提出意见。这种透明度,把整个团队定位为防止操纵的伙伴、而不是被监视是否操纵的对象,与一个从上而下悄悄监管操纵、却从未公开讨论这种风险的系统相比,建立起一种根本不同的与指标项目的关系。

权衡取舍:利与弊

方案优点缺点
自上而下的强制命令,团队参与极少推行快,设计一致从一开始就存在恐惧驱动操纵和低信任度的高风险
团队参与、共同设计的推行建立真正的信任和认同,操纵风险更低推行更慢,需要更多的协调努力
从第一天起就立即进行评价性使用感觉高效,快速地把指标与后果连接起来在任何信任建立起来之前,就激起了最大程度的恐惧和操纵风险
在任何评价性使用之前,延长纯诊断性的证明期建立持久、基于证据的信任领导层最终可能想要的任何评价性用例,实现得更慢

核心张力是推行速度与建立信任之间的张力。一次快速、自上而下的推行,能让一套指标项目迅速运转起来,但存在真正的风险,会激起恰恰是本书自开篇主题起就警告过的那种恐惧和操纵;一次更慢、团队参与、诊断优先的推行,花费更长时间,但建立起了让由此产生的数据真正值得收集的持久信任。坚定地朝有利于建立信任的方向解决这种张力,因为一套推行得快、却产生了被操纵、不可信数据的指标项目,从真正的意义上说,无论部署得多快,都没有实现本书所论证的任何东西。

与团队讨论的问题

  1. 我们当前指标项目的目的和明确的非目标,是在推行之前被传达的,还是工程师先得知了这套项目,之后才听到关于它将如何被使用的安抚? 如果安抚是被动而不是主动到来的,这种顺序本身可能已经对早期信任产生了负面影响,值得诚实地点明。

  2. 被测量的人是否参与了设计描述他们自己工作的指标,还是这套系统在没有任何输入的情况下被强加了下来? 对照这项具体检验评估你实际的推行流程,因为参与本身很重要,与由此产生的指标设计最终有多好无关。

  3. 我们的指标项目是否在多个报告周期中维持了真正纯粹的诊断性使用,还是评价性使用比一次建立信任的推行所建议的时间更早地渗入了进来? 诚实地追溯真实的历史;这里的漂移常常是渐进、非正式地发生的,而不是通过一次明确的政策变化发生的。

  4. 一项指标是否曾经被惩罚性地滥用过,哪怕只有一次,哪怕只是非正式地,组织是如何回应的? 如果发生过这种情况,诚实地评估回应是快速、可见的,还是悄悄地、未被处理的,因为那次回应对整个项目信任的塑造,远比最初的事件本身更重要。

  5. 被测量的团队是否理解每一个护栏为什么存在,还是防操纵的逻辑一直是一个他们从未被直接告知的私人管理关切? 讨论你的组织的护栏推理(主题 1.2)是否真正被透明地分享过,还是一直是一个未被言明的幕后设计考量。

  6. 如果我们今天从零开始重新推行我们的指标,充分应用本主题的指导,这个过程会与实际发生的情况有多不同? 这个回顾性的思想实验,常常揭示出建立信任在时间压力下被走了捷径的具体、可点名的地方,即使最初的推行无法撤销,也值得从中学习。

行业视角

初创公司。 在这个规模上,信任往往更容易建立,因为每天的直接对话自然提供了本主题所建议的那种透明度。风险在于,仅仅因为在一个小型、紧密团结的团队中感觉没有必要,就跳过了对目的和非目标的刻意传达,而这种假设,可能随着团队成长、新员工在没有同样共享背景的情况下加入而悄悄崩溃。

小型企业。 一次简单、直接的对话,解释为什么正在引入一项新指标,以及它将被用于什么、不会被用于什么,在推行之前而不是在担忧浮现之后进行,就能在这个规模上不需要正式流程地捕捉到本主题的大部分价值。

企业。 大型组织的规模和非人格化,既让本主题的指导更难被良好执行,也让把它做对更加关键,因为单一一起处理不当的事件,就可能毒化数十个团队的信任,这些团队是间接听说这件事、而不是直接经历的。刻意投资于本主题所建议的、延长的诊断优先证明期,并在任何指标滥用事件发生之前,就建立起一套清晰、快速、可见的响应协议。

政府。 公共部门组织常常在既有工会保护、既定的公务员文化,以及在某些情况下,与过去绩效管理争议相关联的、对测量举措的历史性不信任的背景下引入指标项目。以格外的耐心和正式性应用本主题的指导,可能直接让工会或员工代表参与设计流程,并预期建立信任的时间线会真正比一个典型的私营部门情境更长。

案例

企业。 一家软件公司最初推出的一套综合工程指标仪表盘,完全由一个中央平台团队设计、没有任何团队层面的输入,遭遇了广泛、悄悄的抵制:全组织的工程师在几周之内就开始非正式地操纵自己报告的数字,恰恰如主题 1.2 对一套不被信任、自上而下的指标系统所预测的那样。六个月后的一次重新推出,这一次直接让团队代表参与指标选择和护栏设计,并明确承诺并真正维持了一段六个月的纯诊断期,然后才开始任何关于更广泛使用的对话,在一年之内产生了可衡量更值得信赖的数据:一次内部审计,比较自我报告和流水线埋点的部署计数,发现两者之间的差距,与最初推行头几个月相比,已经大幅缩小。

政府。 一家州政府机构最初尝试引入工程指标的努力,在两年前因一起事件而被完全放弃,那起事件中,一位经理在一次绩效对话中非正式地引用了一个人的活动数据,这是一起孤立、却未被处理的事件,在随后数年里毒化了整个机构对这项举措的信任,员工在原始项目被悄悄搁置很久之后,依然带着明显的怀疑提起”那个指标的事”。一套新的、被刻意重新推出的项目,明确、公开地直面了这段历史,承认了过去的处理不当,承诺了一项具体的、已发布的非惩罚性使用政策,配以一位具名、承担责任的高管发起人,并为任何未来的滥用担忧建立起一套快速、透明的响应协议。这种对过去失败的明确承认,而不是简单地重新推出、仿佛那段历史不存在,被员工代表专门归功为第二次尝试在第一次没有做到的地方赢得了真正信任的原因。

商业理由:动机、投资回报与总拥有成本

一次建立信任、避免恐惧的推行的回报,非常简单,就是可信的数据,没有这个,本书其他每个主题细致的指标设计工作,都不会产生任何真正的价值。上面的企业案例具体、可衡量地展示了这一点:重新推出的项目的数据,可证明地比最初那次由恐惧驱动的推行的数据更准确,这是对额外的建立信任投资的一份直接、可量化的回报。

总拥有成本主要是时间和组织耐心:延长的诊断优先证明期、设计中的团队参与努力,以及对任何滥用事件快速、可见地做出回应的持续纪律。这份成本是巨大的,但它是本书其他每个主题所依赖的可信数据的必要、不可避免的代价;一次跳过这项投资的快速推行,产生的是一套看起来完整、实际上却悄悄毫无价值的指标项目,被恰恰是本书自第一个实质性主题起就警告过的那种操纵所腐蚀。

反模式与陷阱

  • 一次没有团队参与指标设计的自上而下推行: 从一开始就激起恐惧和操纵,无论指标本身设计得多好。
  • 对目的和非目标的被动而不是主动传达: 让焦虑的猜测填满真空,塑造出难以逆转的早期印象。
  • 在一段真正的纯诊断信任期尚未过去之前,就急于进行评价性使用: 一套新指标项目立即激起操纵行为的单一最常见方式。
  • 对一起指标滥用事件悄悄地、未被处理地回应: 证实了恰恰驱使操纵的那种恐惧,对整个项目的信任造成持久损害。
  • 让护栏和防操纵逻辑保持为一个私人的管理关切: 错过了与被测量的团队进行透明、共享推理的建立信任机会。
  • 在没有直接承认过去失败的情况下,重新推出一套此前处理不当的指标项目: 重复了透明度不足的原始错误,这一次还叠加了未被处理的历史。

成熟度模型

  • 第一级,启动: 指标被自上而下地推行,没有团队参与,目的和非目标即使有被传达,也是被动的。
  • 第二级,发展: 存在一些传达和团队参与,但没有持续的纯诊断证明期,也没有清晰的滥用响应协议。
  • 第三级,标准化: 新的指标项目在全组织范围内被一贯地推行,配以主动传达、设计中的团队参与,以及一段承诺的纯诊断证明期。
  • 第四级,管理: 存在一套快速、透明、经过检验的滥用响应协议,并已被实践过,护栏推理作为标准实践与被测量的团队公开分享。
  • 第五级,协奏: 组织拥有一份经过证明、持续的、可信、低操纵指标数据的记录,直接归因于有纪律、建立信任的推行实践,这份记录随着每一项新指标的引入被主动保护和强化。

讨论思路

  1. 我们当前指标项目的目的,是在担忧出现之前还是之后被传达的?
  2. 被测量的人是否真正参与了我们指标的设计,还是这套系统是被强加的?
  3. 我们的组织是否曾经惩罚性地处理不当过一项指标,我们是如何回应的?
  4. 被测量的团队是否理解我们护栏为什么存在,还是这个推理一直是保密的?
  5. 如果我们今天充分关注本主题重新推出我们的指标项目,我们会做出什么不同的做法?

要点回顾

  • 恐惧腐蚀数据的速度和彻底程度,超过指标设计中的任何技术缺陷; 一项完美设计、却推行得糟糕的指标,依然会被操纵。
  • 直接让被测量的团队参与指标设计, 并在推行之前主动传达目的和明确的非目标。
  • 从纯诊断性开始,用多个周期证明它, 然后才考虑任何评价性使用。
  • 立即、可见地回应第一起处理不当的事件; 沉默证实了驱使操纵行为的那种恐惧。
  • 与被测量的团队透明地分享护栏和防操纵推理, 建立起伙伴关系,而不是监管关系。

参考文献与延伸阅读

  • Drive: The Surprising Truth About What Motivates Us,Daniel H. Pink著(内在与外在动机之分,与为什么恐惧会腐蚀指标驱动的行为直接相关)。
  • The Tyranny of Metrics,Jerry Z. Muller著(实施不当的指标项目所带来的组织和文化代价)。
  • Site Reliability Engineering: How Google Runs Production Systems,Betsy Beyer、Chris Jones、Jennifer Petoff、Niall Richard Murphy编(本主题把无责文化原则从事件响应延伸到指标项目推行的一般情形)。
  • Accelerate: The Science of Lean Software and DevOps,Nicole Forsgren、Jez Humble、Gene Kim著(支撑可信、高绩效工程指标实践的组织文化研究)。