3.2 满意度与幸福感指标
概述与动机
满意度与幸福感,SPACE(主题 3.1)中的S,是任何系统遥测都无法直接观察到的维度。一名工程师是否觉得自己的工作有意义,是否感到受到团队的支持,是否正在走向职业倦怠,这些都不会在版本控制日志或CI流水线中留下痕迹。它必须被问出来。本主题讲的就是如何问得好:设计出能对一种真正主观、真正重要的状态产生可信信号的测量方式,而不是一个看起来精确、实际上几乎什么都没衡量到的数字。
这个维度之所以重要,是因为它是那些会在别处、在更晚的时候、以更高代价显现出来的成本的先行指标。满意度下降,比离职访谈更早预示人员流失。职业倦怠风险上升,比缺陷率更早预示质量崩溃。一个只盯着交付和活动指标的组织,往往要等到一个幸福感问题已经变成一次离职、一次事件,或者一段需要数月才能诊断出来的悄然、持续的产出下滑,才会察觉到它。直接衡量满意度与幸福感,买到的正是在这一切发生之前采取行动的前置时间。
对大团队而言,这个维度也是主题 1.1 诊断性用途与评价性用途的区分最尖锐地体现出来的地方。用来理解和改善团队状况的满意度数据是有价值、低风险的。同样的数据一旦被用来给团队互相排名,或者更糟,给个人互相排名,几乎会立刻腐蚀这个调查工具,因为人们一旦怀疑答案会被用来对付自己或自己的团队,就会停止诚实作答。拥有正式绩效评估周期的企业和政府组织,尤其容易陷入这种漂移,需要明确地防范它。
核心原则
- 满意度与幸福感无法从系统遥测中观察到。 这个维度必须被刻意地、恰当地问出来。
- 匿名性不是可选项。 诚实答案与个人后果之间任何被感知到的联系,都会摧毁这个信号。
- 这个维度是先行指标,而不是滞后指标。 它在人员流失和质量问题显现在别处之前就能预示它们。
- 职业倦怠是一种具体的、可识别的模式,而不只是泛泛的不快乐。 要明确地为它设计测量,而不是仅仅依赖一个笼统的满意度分数。
- 趋势比任何单次读数都更重要。 单次满意度分数只是一张快照;连续多次调查的趋势才是真正的信号。
建议
使用经过验证的调查工具,而不是自己发明
幸福感和职业倦怠有既定的、经过验证的测量工具,最著名的是马斯拉赫职业倦怠量表,它跨三个公认的维度衡量职业倦怠:情感耗竭、去人格化或愤世嫉俗,以及个人成就感降低。借用一个既定的、经过验证的工具,哪怕只是一个精简的改编版本,也比内部临时拼凑出的一组问题产生更可信的数据,因为经过验证的工具已经被检验过,确实衡量了它们所声称要衡量的东西。
保证真正的匿名性,并对你是如何做到的保持透明
明确声明,并且要言行一致,个人的回答无法被追溯到具体某个人,在响应模式原本可能被推断出来的小团队中尤其如此。使用一个组织自身无法去匿名化的第三方调查工具,只在群体规模达到最低门槛(通常是五名或更多受访者)以上才发布汇总结果,以防止在小团队中被推断出来,并在要求任何人参与之前清楚地传达这项政策。哪怕只是一次意外的匿名性被打破的事件,也会摧毁人们对未来一切调查的信任。
跟踪随时间变化的趋势,而不是孤立地看单次读数
单次满意度分数本身的诊断价值有限;连续三个调查周期内的下降趋势,则是一个强得多、也更具可操作性的信号。以一致、适中的节奏运行调查,常见的是按季度,并且始终把结果与历史趋势线一并呈现,而不是作为一个孤立的数字,这样读者和受访者都能对照真正的变化来校准,而不是被一次性的噪声干扰。
把泛泛的满意度与具体的职业倦怠风险区分开来
一个笼统的满意度问题(“你对自己的工作满意吗?“)和一个针对职业倦怠的具体问题(“你觉得自己的工作让你感到情感上耗竭吗?“)衡量的是相关但不同的东西,一个团队可能在前者上得分尚可,却在后者上显现出真正的警示信号。在你的调查设计中同时纳入两者,并且把一个针对职业倦怠的具体警示信号,当作需要比一次泛泛满意度下滑更快、更直接跟进的情况来对待。
谨慎地将调查数据与客观佐证信号配对
在可能的情况下,用一些与幸福感有合理关联的客观信号,来佐证满意度趋势:自愿离职率、持续的下班后工作模式,或未使用休假时间比例的上升。把这些用作佐证,绝不能用作直接询问的替代品,并且要小心不要让这种佐证本身变成一种监控机制,从而反过来损害信任,并且讽刺地损害满意度本身。
权衡取舍:利与弊
| 方案 | 优点 | 缺点 |
|---|---|---|
| 临时拼凑的内部调查问题 | 构建速度快,贴合具体情境 | 未经验证;不清楚它是否真的衡量了它所声称的东西 |
| 经过验证的工具(例如改编版马斯拉赫职业倦怠量表) | 经过检验,可比较,信号更可信 | 需要更多的前期投入,可能需要针对工程情境做改编 |
| 频繁的简短脉冲调查 | 受访者疲劳度低,信号接近实时 | 每次调查的深度较浅;如果过度解读,存在噪声风险 |
| 不频繁的深度调查 | 信号丰富、详尽 | 对像急性职业倦怠这样快速发展的问题,捕捉得较慢 |
核心张力是深度与频率之间的张力。一份深入、经过验证、按季度运行的调查能给出可信、详尽的图景,但可能错过两个周期之间快速发展的问题;频繁的简短脉冲调查能更快地捕捉问题,但如果被过度使用,存在数据较浅、较嘈杂以及受访者疲劳的风险。解决这种张力的办法,是把一份更深入、经过验证的季度调查作为主要工具,辅以更频繁的、非常简短的可选脉冲检查(一两个问题)来实现早期预警,而不必每次都要求同等深度的参与。
与团队讨论的问题
我们使用的是经过验证的调查工具,还是我们自己发明的、没有证据表明它确实衡量了满意度或职业倦怠的问题? 如果你当前的调查是临时拼凑出来的,考虑从一个既定工具(例如马斯拉赫职业倦怠量表)改编,是否会产生更可信的数据。
我们能否诚实地保证匿名性,包括在响应模式原本可能被推断出来的小团队中? 走一遍你实际的调查工具和汇总做法,检查一个有心的管理者在实践中是否能够推断出某个人的答案,哪怕政策上说他们不应该能够。
我们是否曾见过满意度数据预示了后来在其他指标中显现出来的人员流失高峰或质量问题? 回顾你的调查历史,对照你的人员流失和事件数据,看看事后是否能看出一个先行指标的模式。如果你从未检查过,这件事本身就值得讨论。
我们的调查是把泛泛的满意度与具体的职业倦怠风险区分开来,还是依赖一个混合在一起的问题? 一个团队可能在泛泛满意度上看起来还不错,底下却显现出真正的职业倦怠警示信号;检查你当前的工具能否真正捕捉到这种差异。
满意度数据是否曾经,哪怕只是非正式地,被用来比较或给团队排名? 这种朝评价性用途的漂移,几乎会立刻腐蚀调查工具,因为受访者一旦怀疑存在竞争性后果,就会改变他们的答案。
我们实际的回收率是多少,回收率下降本身又在告诉我们什么? 连续多次调查中回收率的下降,本身就是一个信号,往往意味着人们对这个流程的信任正在流失,或者出现了调查疲劳,这值得就其本身进行调查,而不应被当作一个数据收集上的小麻烦而打发掉。
行业视角
初创公司。 对一小撮人来说,正式的匿名调查可能感觉没有必要,直接的对话往往比一份季度性工具更快地揭示满意度问题。风险在于创始人把没有抱怨误认为没有问题;一旦团队成长到不再是人人每天都在交流的规模,就引入哪怕只是轻量级的匿名沟通。
小型企业。 一个简单的、免费或低成本的匿名调查工具,配上一小组改编自经过验证工具的问题,按季度运行,在没有专门人员分析职能的情况下也是可以实现的。不要因为团队感觉关系紧密就想跳过匿名性保证;恰恰是这种紧密关系,让诚实的负面反馈更难被直接说出口。
企业。 在这个规模上,调查基础设施需要真正的投入:一个恰当的第三方工具、一项最低群体规模的汇总政策,以及一项清晰、一贯传达的非评价性用途政策。回报也相应更大,因为在一个人数庞大的组织中,在职业倦怠趋势驱动人员流失之前捕捉到它,能保护数量大得多的机构知识。
政府。 公共部门薪酬限制带来的留任压力,使这个维度具有战略重要性,而不是可有可无的选项。幸福感数据可以直接为非货币性留任投资(工具、受保护的时间、工作量管理)的预算请求提供依据,而这些投资是单靠薪酬限制无法解决的,前提是数据收集本身足够可信,可以被有信心地引用。
案例
企业。 一家云基础设施公司的平台团队,在超过一年的时间里,泛泛满意度得分一直不错,与此同时一个改编自马斯拉赫职业倦怠量表情感耗竭子量表的、针对职业倦怠的具体问题,却在连续四个季度中显示出稳定的下降。领导层最初倾向于因为泛泛满意度数字看起来不错而不予理会,在连续第二个季度下降后进一步调查,发现该团队在一次人员编制冻结之后,已经承受着不可持续的待命负荷(主题 6.3)将近一年。恢复足够的待命人员配置,在两个季度内扭转了职业倦怠趋势,远早于它转化为该公司数据显示是这种模式典型下游后果的人员流失高峰。
政府。 一家州政府IT机构,长期难以在薪酬上与私营部门雇主竞争,专门利用幸福感调查数据,为一项受保护专注时间政策而不是它无法争取到的加薪提出预算论证。调查显示,在表示自己正在积极求职的受访者中,打断频率和会议负荷,而不是薪酬,才是离职意愿最强的预测因子。由此产生的政策,每周锁定两个不受打断的下午时段用于专注的工程工作,在随后一年里与满意度分数和自愿留任率的可衡量改善相关联,而所需成本只是一次有竞争力加薪所需成本的一小部分。
商业理由:动机、投资回报与总拥有成本
直接衡量满意度与幸福感的回报,是提前预警:一个能在职业倦怠趋势转化为人员流失之前整整一年就捕捉到它的组织,能以只是招聘并培养一名替代者所需成本一小部分的代价进行干预,而即便招到人,通常也需要数月才能达到充分的生产力。一名经验丰富的工程师自愿离职,给组织造成的成本,远远超过本可以提供预警的调查基础设施所需的成本。
总拥有成本包括调查工具、保证并维持真正匿名性的纪律,以及组织愿意根据数据所显示的内容采取行动、而不是收集数据后对不便的结果视而不见的承诺。最后这项成本,也就是采取行动的意愿,往往才是真正的瓶颈,而不是测量本身;一份揭示出问题却无人处理的调查,会像一次被打破的匿名性承诺一样确凿地侵蚀人们对这个工具的信任。
反模式与陷阱
- 临时拼凑、未经验证的调查问题: 产生可靠性不明的数据。
- 薄弱或被打破的匿名性保证: 摧毁诚实的回答和对这个工具的信任,往往是永久性的。
- 对单次读数做出反应,而不是跟踪趋势: 对噪声反应过度,或者错过真正缓慢的下滑。
- 把泛泛满意度与针对职业倦怠的问题混在一起: 可能把一个真正的警示信号掩藏在一个看起来还不错的平均值之中。
- 用满意度数据给团队排名或比较: 这种评价性漂移会腐蚀诚实的回答。
- 收集了数据,却从不对不便的结果采取行动: 侵蚀人们对这份调查的信任,其彻底程度不亚于一个被打破的匿名性承诺。
成熟度模型
- 第一级,启动: 满意度与幸福感完全不被衡量,或者只通过非正式、无结构的对话来了解。
- 第二级,发展: 存在一份临时拼凑的调查,但缺乏验证、一致的节奏,或强有力的匿名性保证。
- 第三级,标准化: 一份经过验证或改编的调查工具,在全组织范围内以一致的节奏运行,配有强有力且经过传达的匿名性保证。
- 第四级,管理: 趋势在连续多个周期中被主动跟踪,针对职业倦怠的具体信号与泛泛满意度被区分开来,组织拥有一套有文档记录的、针对警示信号采取行动的流程。
- 第五级,协奏: 幸福感数据直接为人力规划和留任投资提供依据,并谨慎地与客观信号相互佐证,组织能够指出具体的干预措施,这些措施在一次被测量到的下滑转化为人员流失或质量问题之前就将其扭转。
讨论思路
- 我们当前的调查工具能否经得起对其真正匿名性的审视?
- 满意度或职业倦怠趋势是否曾经预示过后来在别处显现出来的问题?
- 我们对一份不想听到的调查结果,有什么样的行动流程?
- 我们目前的测量是否把职业倦怠风险与泛泛满意度区分开来?
- 我们的幸福感数据现在最能为哪项非货币性投资提供依据?
要点回顾
- 满意度与幸福感必须被直接问出来;没有任何系统遥测能观察到这个维度。
- 在可能的情况下使用经过验证的工具,并保证真正的、经过良好传达的匿名性。
- 这个维度是人员流失和质量问题的先行指标,否则这些问题会在更晚、以更高代价的方式显现出来。
- 把泛泛满意度与具体的职业倦怠风险区分开来,并跟踪随时间变化的趋势,而不是单次读数。
- 绝不要用这些数据来给团队排名或比较;那种漂移几乎会立刻腐蚀诚实的回答。
参考文献与延伸阅读
- Maslach, Christina, and Susan E. Jackson, Maslach Burnout Inventory(用于跨三个维度衡量职业倦怠的、经过验证且被广泛使用的工具)。
- Forsgren, Nicole, Margaret-Anne Storey, Chandra Maddila, Thomas Zimmermann, Brian Houck, and Jenna Butler, “The SPACE of Developer Productivity,” ACM Queue (2021)。
- Drive: The Surprising Truth About What Motivates Us,Daniel H. Pink著(与调查设计相关的动机与满意度研究)。
- The Burnout Challenge: Managing People to Avoid Burnout and Improve Wellbeing,Christina Maslach、Michael P. Leiter著(职业倦怠的组织性成因与干预措施)。