8.4 工程指标项目的成熟度模型
概述与动机
本书第1部分到第7部分的每个主题,都以自己的五级成熟度模型结尾,专门针对该主题具体的指标家族。本主题做的是不同的事情:它退后一步,问的是对整套指标项目而言,成熟度看起来是什么样子,也就是那种共同产出、治理并据以采取行动的组织能力,把所有那些单项指标整合在一起。一个组织可能在单项DORA指标成熟度上达到第四级,同时在整体项目成熟度上依然处于第一级,比如说,如果它拥有出色的埋点,却没有治理(主题 1.4),或者拥有出色的单项指标,却经历了一次由恐惧驱动的推行(主题 8.3),无论每一项指标被设计得多么好,都已经腐蚀了底层数据。
本主题的模型围绕五个横贯本书所涵盖每一个单项指标家族的维度构建:治理与所有权(主题 1.4)、埋点质量(主题 1.5)、结果与产出的平衡(主题 1.3、主题 7.4)、文化信任(主题 8.3),以及持续改进(主题 1.1 在本书一开始就确立的退役与修订纪律)。一个组织整体的项目成熟度,现实地说是这五个维度中的最小值,而不是平均值,因为其中任何一个维度,尤其是文化信任,一旦存在严重的弱点,就可能损害所有其他维度力量的价值,恰如主题 8.3 直接论证过的那样。
对大团队而言,这个整合模型给领导层提供了一件单一、诚实的组织自我评估工具,与本书自始至终提供的逐主题成熟度检验既不同、又互补。跨业务单元公平比较指标成熟度的企业组织,以及向监督机构报告项目成熟度的政府组织,都能从这份单一、横贯的评估中受益,而不需要自己把四十五份单独的主题级成熟度读数综合成一幅连贯的整体图景。
核心原则
- 项目成熟度是各维度中的最小值,而不是平均值。 文化信任方面的一个严重弱点,会损害其他各处的力量。
- 五个横贯维度是治理、埋点、结果平衡、文化信任和持续改进。 每个维度都把许多单独主题的线索汇聚在一起。
- 这个模型补充、而不是取代各主题级别的成熟度模型。 把两者一起使用,才能得到完整的图景。
- 自我评估应当诚实、具体,而不是抱负性的。 用具体证据,对你实际所处的位置打分,而不是你打算达到的位置。
- 各级别之间的移动,需要刻意的投入, 而不只是时间的流逝;成熟度不会自动累积。
建议
用具体证据独立评估五个维度中的每一个
对治理,检查每一项有后果的指标是否有一位具名的所有者和一份有文档记录的章程(主题 1.4)。对埋点,检查指标是否在可能的情况下来自自动化来源,而不是自我报告(主题 1.5)。对结果平衡,计算你主要仪表盘上以结果加权与以产出加权的指标的实际比例(主题 7.4)。对文化信任,诚实地评估你的推行历史中是否曾经包含过一次未被处理的、惩罚性使用一项指标的事件,以及它是如何被处理的(主题 8.3)。对持续改进,检查你的组织是否有一份有文档记录的、退役那些不再物有所值的指标的历史记录(主题 1.1)。在把这些维度组合起来之前,先独立地为每一个维度打分。
把各维度中的最小值当作你诚实的整体分数
抵制把你五个维度分数平均成一个更讨喜的综合分数的诱惑。一套拥有出色埋点(第四级)、却文化信任薄弱(第一级)的项目,在任何有意义的层面上都不是一套第二级或第三级的项目;那个薄弱的维度会积极地损害强项的价值,因为一份被恐惧驱动的操纵所腐蚀、不可信的数据,不会因为是用出色的埋点收集来的而得到挽救。诚实地报告这个最小值,即使它产生的整体图景比平均值所展示的更不讨喜。
把这个模型与主题级别的模型一并使用,而不是取而代之
这个整合模型回答的是”我们整体的项目有多成熟”;第2部分到第8部分自始至终的各个主题级别模型回答的是”我们对这项具体指标的实践有多成熟”。把两者一起使用:用整合模型来确定哪个横贯维度最需要投入,用主题级别模型来识别在那个维度内,哪些具体的指标家族最需要关注。
按一个固定的节奏重新审视这份评估,而不只是在危机促使之下才审视
遵循本书一贯的治理纪律(主题 1.4),按一个固定的节奏,常见的是每年,重新评估项目成熟度,而不是只在一场危机(一起被发现的操纵事件、一份损害可信度的公开报告)迫使这个问题浮现之后才评估。一套只在被动情况下审视自身成熟度的项目,错过了在一个正在弱化的维度产生一起真实、代价高昂的事件之前捕捉并处理它的机会。
诚实地把一个低分当作投入的起点,而不是一个不及格的成绩
遵循主题 1.1 为整本书所确立的诊断性而不是评价性的框架,把任何维度上的一个低分数,当作一项刻意投资计划的起点(主题 8.5 的采用路线图是直接的下一步),而不是一份让人心情糟糕的裁决。大多数被诚实评估过的组织,都会在这个模型的某处发现真正的弱点;具有成效的回应是有针对性的投资,而不是对这个分数感到防备。
权衡取舍:利与弊
| 方案 | 优点 | 缺点 |
|---|---|---|
| 把五个维度分数平均起来 | 产生一个单一、简单、更讨喜的数字 | 掩盖了一个维度中的关键弱点正在损害其他维度 |
| 取各维度中的最小值 | 诚实、可操作,正确识别出真正的制约因素 | 如果一个维度显著落后于其他维度,可能让人感到气馁 |
| 只使用主题级别的模型 | 详尽、针对具体指标的指导 | 错过了对整体项目健康状况的横贯视角 |
| 只使用这个整合模型 | 简单、高层次 | 错过了主题级别模型所提供的具体、可操作的细节 |
核心张力是简单性与诚实性之间的张力,呼应了主题 5.5 对虚假精确单一数字的告诫。一个平均分数报告起来更简单、也更让人舒服,但它积极地掩盖了对你项目整体可信度和价值的真正制约。以有利于诚实的方式解决这种张力:报告最小值,并把这个整合模型与各个主题级别的模型一并使用,才能得到一幅完整、准确、可操作的图景。
与团队讨论的问题
诚实、独立地评估,我们五个维度,治理、埋点、结果平衡、文化信任和持续改进,各自实际上得分多少? 明确地逐一走一遍每个维度,用具体证据而不是印象,然后再把它们组合成一份整体评估。
我们最薄弱的维度是什么,这与我们对项目整体健康状况的直觉相符吗,还是它揭示出我们此前从未直接点明的东西? 例如,文化信任方面的一个低分,可能损害人们对一份在技术上看起来出色的数据的信心。
我们是否一直在把优点和缺点平均成一幅更讨喜的整体图景,而不是诚实地报告我们最薄弱的维度作为真正的制约因素? 诚实地面对你的组织此前是如何谈论自己的指标成熟度的。
我们上一次正式重新评估整体项目成熟度是什么时候,那是由一场危机促成的,还是由一个刻意、定期的节奏促成的? 如果只是由危机促成,讨论一个定期的评估节奏今后会是什么样子。
对我们最薄弱的维度进行有针对性的投资,具体来说,在下个季度会是什么样子? 直接从评估转向行动,把本主题的诊断与主题 8.5 的采用路线图连接起来。
我们的自我评估,与一位组织之外的人所做的诚实外部审阅相比会如何? 这个问题检验了你的内部评估本身,是否可能受到本书自始至终所警告的那种乐观偏见的影响,值得定期用真正的外部视角来检验。
行业视角
初创公司。 在非常小的规模上,正式的五维度评估很可能没有必要,非正式的认知通常已经覆盖了这个模型所能揭示的大部分内容。值得及早养成的习惯,只是专门在文化信任方面保持诚实,因为一家年轻公司早期的指标文化,会为此后一旦组织显著成长就变得难以改变的基础定下基调。
小型企业。 一年一次简单、诚实、非正式地走一遍这五个维度,即使没有正式打分,也能在这个规模上不需要结构化评估流程地捕捉到本主题的大部分价值。
企业。 这个整合模型对公平比较众多业务单元之间的指标成熟度尤其有价值,因为在数十个团队之间进行逐主题比较会变得笨重不堪。用它来把全组织范围的投资,优先投向在各单元中显示出最普遍弱点的那个维度。
政府。 一份有文档记录、诚实的成熟度自我评估,使用这个整合模型,是向监督机构证明项目严谨性的一件真正有用的产出物,前提是这份评估是诚实进行的,而不是抱负性地进行的。考虑对这份自我评估本身进行定期的外部审阅,尤其是对文化信任这个维度而言,那是纯粹从内部视角最难准确评估的一个维度。
案例
企业。 一家物流科技公司最初的自我评估,把它的埋点维度打到了第四级(来自流水线和系统的自动化、全面数据来源),但把它的文化信任维度打到了第一级,原因是两年前一起未被处理的指标滥用事件从未被直接承认或修复(直接呼应了主题 8.3 的政府案例)。领导层最初的本能,是把这些平均成一幅体面的第二级或第三级整体图景;本主题基于最小值的打分法的一次更诚实的应用,正确地识别出文化信任才是整个项目价值的真正制约因素,因为即使出色的埋点,也在产生工程师们意识到过去那起事件、依然没有完全信任或诚实地据以报告的数据。对文化信任修复的有针对性投资,直接遵循主题 8.3 的指导,作为这次诚实的、基于最小值的评估的直接结果,被优先于进一步的埋点投资。
政府。 一家国家统计机构在进行它第一次正式的成熟度自我评估时,把这个整合模型作为一次更广泛技术治理审查的一部分,发现它的治理维度得分不错(清晰的所有权、有文档记录的章程),但它的结果平衡维度得分很差,绝大多数被跟踪的指标都是产出和活动导向的,尽管第7部分对结果加权的论证在该机构的技术领导层内已经在智识上被很好地理解了。这个诚实、具体的发现,而不是一种”我们应该更多地衡量结果”的模糊笼统感觉,给了该机构随后的投资计划(主题 8.5)一个具体、基于证据的起点,而该机构向监督委员会的后续报告,专门引用了这份成熟度评估,作为重新定向的指标投资战略的依据。
商业理由:动机、投资回报与总拥有成本
一份诚实、基于最小值的成熟度自我评估的回报,是正确识别出对一套指标项目价值的真正制约因素,而不是在一个已经很强的维度上进一步投资,同时一个薄弱的维度继续损害整个项目的可信度,恰恰是上面两个案例所展示的模式。这种定位效果是这个模型的主要价值:它把有限的改善投资引导到真正能移动整体项目成熟度的地方,而不是投向恰好最容易或最熟悉的地方。
总拥有成本是评估工作本身,适度而定期,需要权衡的是,继续投资于一个已经很强的维度、同时一个未被处理的薄弱维度(尤其是文化信任)持续悄悄腐蚀这个项目已经建立起来的一切其他价值的风险。
反模式与陷阱
- 把维度分数平均成一个更讨喜的综合分数: 掩盖了对项目整体价值的真正制约。
- 只基于所声称的政策、而不是实际实践进行抱负性评估: 产生一幅不准确、过度乐观的图景。
- 把这个整合模型用作主题级别模型的替代品、而不是补充: 失去了那些单项模型所提供的具体、可操作的细节。
- 只在一场危机迫使这个问题浮现之后才重新评估: 错过了主动捕捉并处理一个正在弱化的维度的机会。
- 把一个低分当作不及格的成绩、而不是一个投资起点: 招致防备心理,而不是本书自始至终所建议的那种具有成效的诊断性回应。
- 从不为这份自我评估寻求诚实的外部视角: 冒着本书自始至终所警告的那种乐观偏见影响到评估本身的风险。
成熟度模型
- 第一级,启动: 不存在正式的横贯评估;单项指标家族可能被独立评估,但整体项目健康状况未被审视。
- 第二级,发展: 存在一些对整体项目优缺点的非正式认知,但没有进行过结构化的五维度评估。
- 第三级,标准化: 在全组织范围内,用具体证据进行了一次结构化、诚实、基于最小值的五维度评估。
- 第四级,管理: 这份评估按一个固定节奏被重复进行,其发现直接、一贯地为有针对性的投资优先级提供依据。
- 第五级,协奏: 组织拥有一份经过证明、持续的诚实自我评估实践,包括定期的外部审阅,并能够指出这份评估的发现直接驱动的具体投资决定。
讨论思路
- 我们现在在五个维度各自上诚实、基于证据的分数是什么?
- 哪个维度是我们真正的制约因素,这与我们的直觉相符吗?
- 我们是否曾经把我们的分数平均成一幅比最小值所显示的更讨喜的图景?
- 我们上一次正式重新评估是什么时候,那是主动的,还是由危机驱动的?
- 对我们自我评估的一次诚实外部审阅,很可能会揭示出什么?
要点回顾
- 项目成熟度横跨五个横贯维度:治理、埋点、结果平衡、文化信任和持续改进。
- 整体成熟度是各维度中的最小值,而不是平均值; 文化信任方面的一个弱点,会损害其他各处的力量。
- 把这个整合模型与本书自始至终各主题级别的成熟度模型一并使用,而不是取而代之。
- 按一个固定的节奏重新评估, 而不是等到一场危机迫使这个问题浮现。
- 遵循本书自始至终的诊断性框架,把一个低分当作一个诚实的投资起点, 而不是一个不及格的成绩。
参考文献与延伸阅读
- Capability Maturity Model Integration (CMMI),软件工程研究所(本主题方法所借鉴其结构灵感的通用成熟度模型方法论)。
- Accelerate: The Science of Lean Software and DevOps,Nicole Forsgren、Jez Humble、Gene Kim著(这个整合模型所汇聚的各主题级别成熟度模型的研究基础)。
- Measuring and Managing Performance in Organizations,Robert D. Austin著(对指标项目健康状况和功能失调的组织性评估)。
- The Fifth Discipline: The Art and Practice of the Learning Organization,Peter M. Senge著(系统层面的组织自我评估与持续改进)。