5.2 功能采用与使用指标
概述与动机
功能采用衡量的是一项功能所服务的对象是否真正使用了它,使用率有多高,以及这种使用是否随时间持续。从一种非常直接的意义上说,它是对本书第2部分到第4部分所衡量的一切的现实检验:一个组织可以频繁地部署、维持优秀的开发者体验、发布经过完美测试的代码,却依然在构建没有人想要的东西。采用数据正是一个工程组织发现自己的产出究竟是否连接到任何真实结果的地方,这正是主题 1.3 所引入的输入-产出-结果区分,应用到本书中最具体的一个案例上:一项已经发布出去的具体功能。
本主题的核心关切在于,采用数据比本书中几乎任何其他指标家族,都更容易以一种讨好人、而不是提供真实信息的方式被测量。一项功能可能纯粹因为好奇心或被迫接触(一个不论用户是否想要都会弹出的模态框)而显示出令人印象深刻的初始采用率,而真正的、持续的价值交付,用人们在新鲜感褪去之后是否仍在继续使用来衡量,讲述的可能是一个完全不同的故事。区分真正的采用与一次暂时的激增,是本主题的核心技术挑战,而把这一点弄错,常常导致组织庆祝那些正在悄悄失败的功能,同时放弃那些才刚刚开始找到受众的功能。
对大团队而言,功能采用数据让路线图的优先排序变得基于证据,而不是由谁最有说服力地为自己团队的工作辩护所驱动。管理着庞大产品组合的企业组织,需要采用数据来识别哪些投资物有所值;构建面向公民的数字服务的政府组织,需要它来证明公共投资转化成了人们真正使用的服务,而不只是在技术上存在的服务。
核心原则
- 初始采用和持续采用是不同的信号。 出于好奇心或被迫接触而产生的一次激增,与真正的、持久的价值交付并不相同。
- 采用情况应当对照这项功能所服务的受众来衡量, 而不是不加区分地对照你整个用户基础。
- 低采用率的功能并不自动等于失败。 它可能是被发现得不好、定位得不好,或只是刚刚推出;在下结论之前先调查。
- 使用的留存,比单一的采用快照更重要。 跟踪尝试过一项功能的人,是否会持续回来使用它。
- 采用数据暴露在通过强迫接触或暗黑模式来操纵的风险之下。 一个通过让一项功能难以避开而虚增的数字,不是一个真实的信号。
建议
把初次尝试与持续留存区分开来
跟踪两个独立的数字:至少尝试过一次这项功能的目标受众百分比(初始采用),以及在一段有意义的时期(例如四周或八周)之后仍在使用它的百分比(留存采用)。一项高初始尝试率、低留存率的功能,暗示的是可发现性起了作用,但功能本身没有交付足够的价值来让人们持续回来,这是一个与低初始尝试率、高留存率非常不同的诊断,也需要非常不同的修复方式;后者暗示的是一项真正有价值、却没有足够多人知道的功能。
在衡量采用之前先精确定义目标受众
如果一项功能本来就只面向一个特定群体,那么对照你整个用户基础衡量出的采用率,就可能具有误导性:一项面向企业管理员的功能,对照一个大多是个人用户的基础来衡量,无论它实际上为它所服务的对象提供了多好的服务,看起来都会总是采用率糟糕。在发布之前明确定义预期的受众,并对照那个具体的分母来衡量采用情况,而不是对照你的总用户数。
在断定一项功能失败之前先调查低采用率的原因
一个低采用率数字有几种可能的原因,需要非常不同的应对:这项功能真的没有价值,这项功能有价值但可发现性差(用户不知道它的存在),这项功能有价值但解释得不好(用户看到了它,却不理解它的用途),或者测量窗口对一项采用较慢的功能来说,根本还太短,还没来得及找到它的受众。在决定进一步投资、重新设计,还是弃用之前,先调查这些原因中哪一个适用。
留意被强迫接触或暗黑模式虚增的采用率
一个由于一项功能难以避开而驱动的采用数字,一个侵入式的入职流程、一个用户必须关闭的模态框、一个难以更改的默认设置,衡量的并不是真正的价值交付,而把它当作值得庆祝的成就来对待,重复了主题 1.2 替代性操纵模式在产品层面的一种形式。在可行的情况下,把原始采用数字与针对这项具体功能的满意度或净推荐值式信号配对,这样不能转化为真正满意度的强迫接触,就会被捕捉到,而不是被庆祝。
把采用趋势连接回具体的产品和工程决策
当一项功能的采用率意外上升或下降时,把这种变化追溯回一个具体的决定,一次用户界面变更、一次默认设置的变化、一次营销推广、一次性能改善或退步,而不要把这种变动当作一个无法解释的谜团来对待。这把采用数据连接到了可操作的产品和工程学习,让一个具体变更与它对真实使用情况所测得的影响之间形成闭环。
权衡取舍:利与弊
| 方案 | 优点 | 缺点 |
|---|---|---|
| 对照总用户基础衡量 | 简单,单一分母 | 对面向特定群体的功能而言具有误导性 |
| 对照定义好的目标受众衡量 | 公平、准确地反映预期的覆盖范围 | 需要在发布之前刻意定义受众 |
| 只看初次尝试 | 信号快,发布后很快就能获得 | 遗漏了这项功能是否交付了持久的价值 |
| 初次尝试加留存 | 把好奇心与真正的价值区分开来 | 需要等待更长时间(数周)才能形成完整的图景 |
核心张力是速度与诚实性之间的张力。初次尝试数据在发布后几乎立即就能获得,满足了组织报告早期结果的压力,但它本身无法把好奇心或被迫接触,与真正的、持久的价值区分开来。解决这种张力的办法,是尽早报告初次尝试数据,并清楚地标注它是初步的,同时公开承诺在一个固定的、预先确定的时间间隔进行一次后续的留存读数,这样早期的热情就不会在真实信号有时间浮现之前,固化成一个未经审视的成功故事。
与团队讨论的问题
对我们最近发布的功能,我们知道初次尝试和留存使用的分别数字,还是只有一个合并的数字? 如果只存在一个合并数字,这个缺口就恰恰掩盖了本主题视为核心的好奇心与价值之分。
在发布之前,我们是否为这项功能明确定义过目标受众,我们是否正在对照那个具体群体衡量采用情况? 检查你当前的采用分母,是否与这项功能实际服务的对象相匹配,还是它被对照一个不相关的更广泛人群衡量而被稀释了。
对一项低采用率的功能,我们是否调查过几种可能原因(价值低、可发现性差、解释不到位、时间不够)中,究竟是哪一种适用? 针对一项真实的、当前的低采用率功能,走一遍这份具体的诊断清单,而不是默认认为”它一定没有价值”。
我们所报告的采用数字中,有没有哪一部分是被强迫接触、一个侵入式的默认设置,或一个必须关闭的模态框虚增的,而不是真正的自愿使用? 在这里要诚实;这是一种常见且容易陷入的模式,尤其是在有压力要展示早期积极结果的时候。
当一项功能的采用率发生显著变动时,我们能否把这种变动追溯回我们所做的一个具体变更? 如果答案通常是”我们不确定”,这个缺口就限制了你的组织能从自己的采用数据中真正学到多少。
我们是否把采用数字与同一项功能的任何满意度信号配对,还是我们只跟踪原始使用情况? 一个高采用数字配上低满意度,是一个原始使用数据本身完全会遗漏的警示信号。
行业视角
初创公司。 功能采用往往是一家年轻公司拥有的单一最重要信号,与产品市场契合本身密切相关。从第一项功能发布开始,就专门跟踪留存,而不只是初次尝试,因为当公司的生存可能取决于把这个诊断做对时,把真正的价值与早期的好奇心区分开来至关重要。
小型企业。 大多数分析平台以最低的设置成本报告基本的使用数据;主要的纪律,是在衡量之前清晰地定义你的目标受众,而不是不论一项具体功能实际上是为谁构建的,都对照你整个客户基础报告采用情况。
企业。 在这个规模上,采用数据对于在庞大的产品组合中进行公平、基于证据的路线图优先排序至关重要,而把初次尝试与持续留存区分开来的纪律,在这里更加重要,因为一个足够庞大的用户基础,几乎可以为任何发布产生一个看起来令人印象深刻的初始激增,无论其真实价值如何。
政府。 一项面向公民的数字服务的采用情况,是公共投资是否转化为真实公共利益的一个直接、具体的衡量指标,而且它往往比一个交付或活动数量,对监督机构而言更有说服力。对照这项服务实际要服务的人群来衡量采用情况,并诚实地面对可能超出服务自身设计、解释低采用率的障碍(数字素养、可获得性、知晓度)。
案例
企业。 一家项目管理软件公司推出了一项新的协作编辑功能,并庆祝了头两周内令人印象深刻的60%初始尝试率。八周后的一次后续留存读数显示,那些初次尝试者中只有8%仍在定期使用这项功能,揭示出这个高尝试率几乎完全是由一个显眼的、难以关闭的入职提示所驱动的,而不是真正的、持续的兴趣。对已经停止使用这项功能的早期尝试者的定性反馈调查,揭示出一个具体的、可修复的可用性问题,一种不直观的交互模式,一次有针对性的重新设计解决了这个问题,留存使用率在修复后几乎翻了三倍,尽管它从未接近那个具有误导性的高初始尝试数字。
政府。 一个国家就业服务机构推出了一款新的在线职位匹配工具,最初对照该机构整个注册用户基础报告采用情况,产生了一个令人沮丧的低百分比,威胁到该项目的持续资助。一次修订后的分析,专门对照那些正在该工具目标行业积极求职的注册用户子集,也就是真正的预期受众,来衡量采用情况,显示出一个大幅更高、也更准确的采用率。结合一次专门针对那个明确受众的定向推广活动,以及随后一次显示采用者中存在强劲持续使用的留存读数,该项目基于这个经过修正、诚实定位的指标,而不是那个具有误导性、被稀释的原始数字,获得了持续资助。
商业理由:动机、投资回报与总拥有成本
严谨的功能采用测量的回报,是基于证据的路线图投资:一个能够把真正的、留存下来的价值与由好奇心驱动的初次尝试区分开来的组织,能够自信地进一步投资那些真正在起作用的功能,并把精力从没有起作用的功能上转移开,而不是追逐一次具有误导性的初始激增,或过早放弃一项真正有价值、只是被发现得慢的功能。
总拥有成本主要是分析埋点,通常在大多数现代产品分析平台中已经具备,再加上明确定义目标受众、并承诺进行后续留存读数而不是止步于一个早期、不完整信号的纪律。这份纪律成本很低,却能防止误读一次虚假的成功或一次虚假的失败这种代价高得多的错误。
反模式与陷阱
- 只报告初次尝试,从不报告留存: 无法把好奇心或被迫接触,与真正的、持久的价值区分开来。
- 对照错误的分母衡量采用情况: 稀释或虚增了针对一个特定受众群体的功能的信号。
- 在没有调查低采用率具体原因的情况下,就断定一项功能失败: 冒着放弃一项真正有价值、只是被发现得不好或时机不对的功能的风险。
- 庆祝被强迫接触或暗黑模式虚增的采用率: 主题 1.2 替代性操纵在产品层面的一个实例。
- 从不把采用变动追溯回具体的决定: 限制了组织从自身数据中学习的能力。
- 跟踪使用情况,却没有任何配对的满意度信号: 错过了高使用率与低真实价值或低满意度并存的情况。
成熟度模型
- 第一级,启动: 采用不被测量,或者只报告一个单一的、早期的、未经留存验证的尝试数字。
- 第二级,发展: 存在一些采用跟踪,但目标受众没有被精确定义,留存的测量也不一致。
- 第三级,标准化: 对每一项主要功能,初次尝试和留存采用都对照一个精确定义的目标受众被一致地跟踪。
- 第四级,管理: 低采用率的功能在决定重新设计或弃用之前,被系统性地调查具体的根本原因;采用与满意度数据配对。
- 第五级,协奏: 采用数据直接、常规地为路线图优先排序和投资决策提供依据,组织能够有信心地把具体的采用变动追溯回具体的产品和工程决策。
讨论思路
- 最近有哪项功能,我们的初次尝试和留存采用讲述了非常不同的故事?
- 我们上一项功能的目标受众,是在发布之前还是之后才被精确定义的?
- 哪项低采用率的功能,在我们决定它的命运之前,值得一次诚实的根本原因调查?
- 我们目前的采用报告中,有没有哪一部分是被强迫接触虚增的?
- 把采用数据与满意度数据配对,会揭示出关于我们使用最多的功能的什么信息?
要点回顾
- 把初次尝试与持续留存区分开来;出于好奇心或被迫接触而产生的一次激增,不是真正的、持久的价值。
- 对照一个精确定义的目标受众来衡量采用情况,而不是一个不相关的更广泛用户基础。
- 在断定一项功能失败之前,调查具体的原因;几种非常不同的原因需要非常不同的应对。
- 留意被强迫接触或暗黑模式虚增的采用率,并把采用与一个满意度信号配对,以捕捉这种情况。
- 把采用变动追溯回具体的决定,把这份数据变成真正的组织学习。
参考文献与延伸阅读
- Lean Analytics,Alistair Croll、Benjamin Yoskovitz著(可操作指标与虚荣指标,应用于产品使用数据)。
- Continuous Discovery Habits,Teresa Torres著(把产品决策与客户结果证据连接起来,包括采用数据)。
- Hooked: How to Build Habit-Forming Products,Nir Eyal著(留存与习惯养成,以及真正价值与暗黑模式之间的伦理界限)。
- Measure What Matters,John Doerr著(面向结果的目标设定,适用于采用目标设定)。