1.2

1.2 古德哈特定律与指标心理学

概述与动机

古德哈特定律,以经济学家查尔斯·古德哈特命名,通常表述为:当一项衡量变成目标时,它就不再是一项好的衡量。古德哈特1975年最初的观察对象是货币政策,但人类学家玛丽莲·斯特拉森后来的重新表述,才是软件团队真正需要的版本,也正是全书据以建立的那句话。之后每个主题里的每一个指标(部署频率、测试覆盖率、满意度分数)都带有这种风险,而本书中的每一条建议,从某种形式上说,都是应对这种风险的策略。

其机制并不神秘。人们会对激励作出反应,而一个与奖励、评审或声誉挂钩的指标,无论设计者是否有意为之,都是一种激励。一旦团队知道”部署频率”正被关注,让这个数字上升的最便宜方式,未必是设计者本意的那种方式:把一次有意义的变更拆成五次琐碎的部署,数字就上去了,而实际上什么都没有真正改善。这不是一个关于坏人的故事。普通的、出于善意的工程师,面对设计糟糕的激励,恰恰会作出这样的反应,因为塑造压力之下行为的是激励本身,而不是激励背后的意图。

对大型组织而言,风险更高,因为随着规模扩大,指标设计者与其行为受该指标塑造的人之间的距离也在拉大。一位为自己八人团队设计指标的团队负责人,可以直接观察是否有人操纵,并迅速纠正方向。而一项在六百人的事业部推行、或发表在立法机构阅读的政府绩效报告中的指标,会经过一层又一层从未见过其作者的人,这些人完全有理由把指标的字面含义当作目标本身来对待。扭曲程度会随距离而累积,这正是为什么本书把重心放在本主题、而不是放在后面某一个主题的原因。

核心原则

  • 假定每一个被激励的指标都会被操纵。 从第一个版本起就针对这一点进行设计,而不是等扭曲被发现之后才动手。
  • 操纵是理性的,而非恶意的。 人们只是在对你所构建的激励作出合理反应;把责任怪到他们头上,什么问题也解决不了。
  • 与指标所有者的距离越远,扭曲风险越高。 一个数字离理解其意图的人越远,它就越容易变成规则的字面文字,而不是规则的精神。
  • 比率与区间比原始计数更能抵御操纵。 原始计数奖励数量;一个选得好的比率奖励的是你真正想要的那种行为。
  • 护栏对于被激励的指标而言并非可有可无。 你所附带奖励的每一个指标,都需要一个不得恶化的配对反向指标。

建议

按激励暴露程度为每个指标分类

在把任何指标发布到任何可见的地方之前,直接问一句:是否有人的奖励、评审、声誉或预算,取决于这个数字朝某个特定方向移动?如果是,它就是一个被激励的指标,在上线之前需要一个护栏(见下文)。如果不是,它就是一个诊断性指标(主题 1.1),操纵风险较低,但绝不为零,因为人们仍然可能去塑造一个他们只是预期日后会据此被评判的数字,即便今天并没有正式挂钩任何激励。

优先选用比率、比例与同期群,而非原始计数

像”关闭的工单数”这样的原始计数,可以通过多做一些低价值的事情来操纵。而像”首次接触即解决的工单占比”这样的比率,奖励的是背后的行为本身,而不是数量。同期群(一个由共同起点定义的群体,例如某一周内所有的部署)能防止近期的不良趋势藏身于一个看起来体面的长期汇总数字之中。凡是在计数与捕捉同一底层行为的比率之间做选择时,都选比率。

为每一个被激励的指标配对一个护栏

护栏指标是一个配对的反向指标,在主指标改善的同时,它不得恶化。部署频率与变更失败率配对;交付周期与缺陷逃逸率配对;支持团队的处理时长与客户满意度配对。护栏正是让廉价操纵变得明显昂贵的机制:一个通过恶化护栏来改善被激励数字的团队,会被这种配对关系当场抓住,而不是靠运气抓住。护栏应与主指标同时设计,绝不能等操纵已经被发现之后才作为事后补救加上去。

留意四种经典的操纵模式

古德哈特定律之下的扭曲,往往落入少数几种可辨识的形态之中。阈值操纵一路优化到恰好达标便停止(95%的测试覆盖率目标,催生出仅为凑够95%而写的琐碎测试,而非真正的覆盖)。定义操纵改变的是”什么算数”,而不是”发生了什么”(重新定义”已解决”,把疑难案例排除在外)。时间操纵改变的是记录工作的时间,而不是工作实际发生的时间(在报告窗口关闭前集中批量部署)。替代操纵在放弃指标本意的同时,满足了指标的字面要求(把一次真实的变更拆成许多琐碎的变更,以抬高部署频率)。向你的团队明确点出这些模式的名字,会让它们一旦出现在你自己的数字里时,更容易被察觉。

尽可能把衡量与奖励分开

最强大的护栏其实是结构性的:把指标与个人奖励解耦。一个纯粹用于理解系统、没有任何人的薪酬、评分或地位随其走向而变化的指标,所面临的操纵压力,要远远弱于一个与评价挂钩的指标。这正是为什么主题 1.1”诊断性与评价性”的区分在实践中如此重要:让一个指标保持诊断性质,往往比事后投入再多的护栏工程都更便宜、更有效。

权衡取舍:利与弊

方案优点缺点
原始计数计算与解释简单极易通过堆量操纵
比率与比例奖励正确的行为,抵御数量操纵可能掩盖分母萎缩的问题
护栏配对让廉价操纵变得明显昂贵需要定义、拥有并维护的指标翻倍
仅供诊断(不挂钩个人奖励)各方案中操纵压力最低领导层可拉动的直接激励杠杆较弱
重度激励的指标行为反应强烈且迅速扭曲风险高,往往在一个报告周期内就会出现

核心张力是激励力度与扭曲风险之间的张力。让行为改变最快的那些指标(把数字直接与奖励挂钩)恰恰是最容易受古德哈特定律影响的那些。解决之道是把强激励留给那些真正难以被廉价操纵的结果指标,并且对任何你确实要激励的指标,都同时设计护栏,而不是等第一次扭曲出现之后才临时补上。

与团队讨论的问题

  1. 对于每一个有人的奖励与之挂钩的指标,最廉价的操纵方式是什么,我们今天能抓到这种操纵吗? 坐下来,刻意为仪表盘上每一个被激励的数字设计一次”攻击”:一个理性、出于善意的团队,会如何在不做底层工作的情况下让它看起来漂亮?如果你说不出一个能抓住这种操纵的方式,那你还没准备好去激励这个指标。这项练习会让人不自在,而这种不自在正是重点所在。

  2. 我们当前的哪些指标已经在无人指出的情况下,滑入了四种操纵模式(阈值、定义、时间或替代操纵)之一? 扭曲很少会自我宣告;它表现为一个看起来很棒的数字,而背后的投诉、事故或客户反馈却在讲述一个不同的故事。逐一用这些模式的名字检视你的仪表盘,诚实地承认是否吻合。

  3. 我们仪表盘上每一个被激励的指标,是否都有配对的护栏,那个护栏是否与指标同时设计? 一个只在操纵被发现之后才添加的护栏,是一次修补,而不是一个设计选择,而且它通常来得太迟,无法阻止对信任造成的第一轮损害。专门为此审计你被激励的指标。

  4. 这个指标从理解其意图的人,一路传到其行为被塑造的人手中,要经过多远的距离? 一个由平台团队构建、却在三层管理之外被消费的指标,或者一个发表在从未见过埋点的人所阅读的公开报告中的指标,远比一个团队为自己设计的指标更容易遭受”重字面轻精神”的操纵。为你最具重要性的那些指标,绘制出这段距离。

  5. 我们是否曾在发现某个指标被操纵后将其激励移除,为此修复付出了多大的信任代价? 组织往往是在付出惨痛代价后才发现古德哈特定律(在一个季度甚至一年的扭曲行为之后),而修复的代价往往高于预防的代价。如果你有一次真实的事件,拿出来讨论,明确提炼出教训,而不是悄悄翻篇。

  6. 在哪些地方,我们曾把操纵当成个人诚信问题,而不是对一个设计糟糕的激励的理性反应? 因为个人对你所构建的激励作出可预测的反应而去责怪他们,很少能解决任何问题,反而常常进一步损害信任。把你能想起的每一次操纵事件,重新界定为指标本身的设计问题,而不是当事人的品格问题,并追问怎样的重新设计本可以阻止它发生。

行业视角

初创公司。 团队规模极小时,最快的护栏就是直接对话:每个人都能看到一个数字,并立刻问”等等,这为什么跳了”。真正的风险是创始人把某个指标与融资叙事(不惜一切代价追求增长)挂钩,却没有配对护栏,因为外部投资者恰恰施加了那种遥远、高风险的压力,正是这种压力让操纵变得有吸引力。

小型企业。 现成的工具往往自带围绕计数(已关闭的工单数、已处理的电话数)构建的默认仪表盘,因为计数容易计算。只要工具允许,就主动把这些计数转换成比率,并且在为某个数字确定护栏之前,克制住把它与奖金或评审挂钩的冲动。

企业。 距离是主导性的风险:一个由平台团队为内部诊断而设计的指标,在被三层管理之外的人接手后,会变成一个连设计者都认不出来的KPI。要为此明确设置治理机制(主题 1.4):在任何指标获准用于绩效评审或高管记分卡之前,要求先有文档化的护栏。

政府。 公开发布的绩效指标,在本书涉及的所有类别中承受着最强的操纵压力,因为未达标可能带来预算或政治上的后果。要按固定节奏审计定义本身,而不只是审计数字,因为典型的公共部门操纵模式,是悄悄重新定义”谁算数”(通过重新分类等待名单上的人来”解决”排队问题),而不是真正改善底层服务。

案例

企业。 一家零售科技公司为所有服务设定了99%自动化测试覆盖率的目标,并与用于季度评审的团队级质量分数挂钩。两个季度之内,覆盖率达到了99%,而事故率却上升了。一次审计发现,各团队为了满足覆盖率工具,写出了断言函数”返回而不抛出异常”之类的琐碎测试,而真正的边界情形测试却毫无改善。修复方案是用一个配对指标取代原始的覆盖率目标:覆盖率加上一个变异测试分数(主题 4.2),用以衡量测试是否真的能捕捉到被注入的故障,这样的指标要廉价操纵得多得多。

政府。 某州的失业保险机构,被以”首次付款的中位天数”这一指标衡量,并将其发表给立法机构。在必须达标的压力下,一个地区办公室开始悄悄把较难处理的申请重新归类为”不完整”,并将其排除在分母之外,这使得公布的中位数看起来非常出色,而部分申请人实际等待的时间却远比报告所暗示的要长。一次针对定义本身、而不仅仅是数字的独立审计,揭露了这一做法。该机构的修复措施是冻结定义、公开发布排除标准,并新增一个追踪不完整申请率本身的护栏指标,使得重新分类一旦激增就会变得可见,而不再被隐藏。

商业理由:动机、投资回报与总拥有成本

认真对待古德哈特定律的回报是省下返工的代价。一个提前设计好护栏的组织,只需多花一点额外精力,在第一个指标旁边再定义一个指标。而一个跳过这一步的组织,常常要在扭曲浮出水面之前,白白耗费整整一个季度甚至更长时间的错误努力,随后还要承受撤销被操纵行为、重建对该数字信任的更高代价。上面的零售案例很典型:预防廉价,修复昂贵。

护栏的总拥有成本并不为零:它是需要定义、埋点并审查的第二个指标。但相较于一个悄悄奖励错误行为、却数月无人察觉的激励所带来的无上限成本,这份成本是小而固定的。本书之后的每个主题都把这笔权衡计入其中,这正是为什么护栏配对作为一项建议,会贯穿本书余下的部分,而不仅仅出现在本主题。

反模式与陷阱

  • 发布一个没有护栏的被激励指标: 本书中仪表盘失真最常见的根源。
  • 把操纵当作个人品行问题: 因一个对设计糟糕的激励作出理性反应而责怪个人,什么问题都解决不了。
  • 只审计数字,从不审计定义: 典型的公共部门失败模式,指标看起来没问题,只是因为”谁算数”被悄悄改变了。
  • 假定一个作为诊断性指标运作良好的指标,一旦变成评价性指标依然安全: 一旦挂钩奖励,暴露程度就会立即改变,即便指标本身别无变化。
  • 只在第一次操纵事件之后才设计护栏: 一次在信任已经受损之后才到来的修补。
  • 忽视距离: 假定一个指标在经过好几层管理、或流传到远离其设计者的公开报告之后,仍会被人按设计者的本意来解读。

成熟度模型

  • 第一级,启动: 指标被临时地挂钩激励,从不考虑操纵风险,扭曲往往是在质量或信任明显受损之后才被发现。
  • 第二级,发展: 部分团队事后察觉操纵并非正式地作出调整,但没有提前设计护栏的一致做法。
  • 第三级,标准化: 全组织范围内,每一个被激励的指标在获批之前都必须有文档化的护栏,四种操纵模式被明确命名并加以传授。
  • 第四级,管理: 操纵风险被主动监控:定义被定期审计,护栏配对被审查是否仍能捕捉扭曲,操纵事件本身被作为一项指标来跟踪。
  • 第五级,协奏: 组织把古德哈特定律当作一项常设的设计约束,在每一个新指标被提出时都自动接受审查,并能指出在扭曲发生之前、而不只是之后,就阻止了扭曲的具体重新设计案例。

讨论思路

  1. 我们组织中今天没有护栏、却最具重要性的指标是哪一个?
  2. 我们是否曾见过某个数字在改善,而背后的现实却在恶化?
  3. 如果我们某个公开指标背后的定义被悄悄改变,谁会注意到?
  4. 我们组织最容易陷入四种操纵模式(阈值、定义、时间、替代)中的哪一种?
  5. 如果发现某个重要指标已被操纵了整整一年,这会在信任层面让我们付出多大代价?

要点回顾

  • 古德哈特定律: 一项衡量一旦变成目标,就不再是好的衡量,这一点支配着本书中的每一个指标。
  • 操纵是对激励的理性反应,而非品格缺陷;要修的是激励的设计,而不是人。
  • 凡是能捕捉同一行为之处,优先选用比率、比例与同期群,而非原始计数。
  • 每一个被激励的指标都需要一个护栏,与指标同时设计,而不是在扭曲被发现之后才追加。
  • 留意四种以名字标示的操纵模式:阈值操纵、定义操纵、时间操纵与替代操纵。
  • 指标设计者与其行为受塑造的人之间的距离,会增加扭曲风险;能缩短这段距离,就尽量缩短。

参考文献与延伸阅读

  • Goodhart, C. A. E., “Problems of Monetary Management: The UK Experience” (1975):古德哈特定律的起源。
  • Strathern, Marilyn, “‘Improving Ratings’: Audit in the British University System” (1997):广为引用的重新表述,“当一项衡量变成目标时,它就不再是一项好的衡量”。
  • Seeing Like a State,James C. Scott著(可读性强的指标如何在国家规模上扭曲其所衡量的系统)。
  • The Tyranny of Metrics,Jerry Z. Muller著(对指标执念及其在众多职业中所带来代价的整本书篇幅论述)。
  • Lean Analytics,Alistair Croll与Benjamin Yoskovitz著(虚荣指标与可行动指标之别,以及初创企业情境下的护栏设计)。
  • 美国政府问责署(GAO)关于绩效衡量与《GPRA现代化法案》的指南:公共部门绩效报告与操纵风险。