跳转到主要内容

「减少78%时间」从何而来:如何拆解自动化的效果归因

「减少78%时间」从何而来:如何拆解自动化的效果归因

「减少78%时间」这个数字看起来像是产品自带的属性,但事实并非如此。它是三项彼此独立的改动叠加的结果,每一项单独实施也能起作用,但没有哪一项单独能达到这样的效果。

「我们上线了系统,拿到了78%」和「这78%由什么构成」之间的区别是实际操作层面的。前一种说法无法迁移到其他场景:换一个流程,它会给出另一个数字,原因不明。后一种说法可以完整迁移,因为它指出的是机制,而不是结果本身。

摘要

自动化的效果至少由三部分构成:用规则组装结果以取代手工操作、将结果交付到记录系统(system of record)、以及能够回传并触发下一步动作的事件触发(event trigger)。这些构成部分作用于不同的人群,比例也各不相同,因此最终的百分比无法复现,但构成本身可以复现。

3一个效果数字中的独立构成部分
+14%实地研究中AI助手带来的平均生产率提升
+34%同一研究中新员工的提升幅度

自动化效果由哪三部分组成

拆解的依据不是系统的组成模块,而是消失或发生变化的工作类型。每一部分构成都有各自的机制、受益对象和边界。

用规则组装取代手工操作。过去,经理要打开价目表、用计算器核算、在仓库目录里找图片,再在文本编辑器里排版文档。现在只需选择条目,其余内容自动填入。这部分构成贡献了最明显的时间节省,而且立竿见影:从第一份文档起效果就能看到。它的边界是可规则化的范围——凡是无法写成规则的工作,仍然需要手工完成。

将结果交付到记录系统(system of record)。文档通过一次操作从交易卡片发出,同时归档到同一个位置。这部分构成几乎不节省执行者本人的时间——它节省的是所有其他人的时间:查找发给客户内容的主管、核对条款的会计、接手交易的同事。效果是滞后显现的,因此常常不会被计入投资回报的核算。

回传到闭环的事件触发(event trigger)。客户是否打开了邮件、是否点击了链接——这些事实会触发下一步动作。这部分构成完全不节省时间,它改变的是结果本身:提高最终促成沟通的交易比例。在「节省小时数」的核算中,它的贡献是零;但在营收中并非如此。

构成部分受益对象效果何时可见受限于
按规则组装执行者从第一份文档起可规则化的比例
交付到记录系统除执行者外的所有人一个季度后系统使用的规范程度
事件与触发公司营收一个交易周期后是否存在下一步动作

请留意第二列。不同的构成部分让不同的人群受益,这也解释了实施过程中常见的矛盾:执行者只看到第一部分,主管期待的是第三部分,而公司要为三者一起买单。

技术效果为什么离不开互补性组织投入

认为可以把技术的贡献和组织变革的贡献分开计算,这种想法早就被经济学数据推翻了。

研究

同时在信息技术投资和管理去中心化两方面都位居前半的企业,平均生产率比只在其中一项领先的企业高出5%。在去中心化的公司中,每一美元IT资本的市场估值比集中化公司高出2至5美元

Erik Brynjolfsson(MIT斯隆管理学院)、Lorin M. Hitt(沃顿商学院)。《Beyond Computation: Information Technology, Organizational Transformation and Business Performance》,《Journal of Economic Perspectives》,2000年秋。作者对计量经济学研究的综合:基于1988–1992年300多家大型企业数据的生产函数分析、约400家大型企业组织结构调查、1987–1994年Fortune 1000企业托宾Q值(Tobin's q)分析 · aeaweb.org

先说明局限:这是上世纪八九十年代之交的相关性数据,不是实验结果,不能把其中的百分比直接套用到今天的实施场景。真正有价值的是结论的结构:技术投入与组织变革构成互补性组织投入(complementary organizational investment)的关系,也就是说二者的效果是相乘而非相加的。这正是最终百分比无法归因于其中任何一方的原因。

最终的百分比无法迁移到任何地方,能够迁移的只有构成本身。

平均效果为什么会掩盖真实差异

另一种验证总数字若不拆解就没有意义的方法,是查看带对照组的研究。可以看到「平均效果」其实是由差异很大的数字组成的。

研究

使用生成式AI助手,使客服人员的平均每小时处理量提升了14%。其中新员工和技能较低的员工提升了34%,而经验丰富的员工提升幅度接近于零。

Erik Brynjolfsson(斯坦福大学)、Danielle Li(MIT斯隆管理学院)、Lindsey Raymond(麻省理工学院)。《Generative AI at Work》,NBER工作论文31161号,2023年4月,2023年11月修订。针对一家财富500强企业5179名客服人员分阶段上线(phased rollout)AI助手的实地研究 · nber.org (PDF)

截至目前,这仍是一份工作论文,尚未经过最终同行评审,数据也只来自一家使用单一工具的企业,因此不能直接套用其中的百分比。可以推广的是其中的机制:平均效果是由某一群体的巨大提升和另一群体接近于零的提升共同构成的,「要不要上线」这个决定应该取决于你团队的构成,而不是平均数。

研究

在模型能力范围之内的任务上,能使用该模型的顾问完成的任务数量多出12.2%,速度快25.1%,质量也更高。而在模型能力范围之外的任务上,同样这批人给出正确答案的比例反而比不使用模型的人低19%

Fabrizio Dell'Acqua、Ethan Mollick、Karim Lakhani及合作者(哈佛商学院与波士顿咨询集团合作)。《Navigating the Jagged Technological Frontier》,HBS工作论文24-013号,2023年9月。一项预注册的随机对照实地实验,758名顾问,随机分为三组 · ssrn.com

这里关键在于正负号。同一款工具、在同一家公司,在一类任务上带来正向效果,在另一类任务上带来负向效果。把这两个数字取平均,得到的数值不能描述任何一种真实的使用场景。

如何在自己的流程中拆解效果

这种方法既不需要对照组,也不需要统计学工具,只需要把改动按顺序依次引入,而不是一次性全部上线——而恰恰是这份耐心通常最缺乏。

按此顺序引入改动,可以让每一部分构成的贡献保持可辨识。
00上线前基线测量(baseline measurement):时间、缺陷率、促成回复的比例
01按规则组装
02交付到记录系统
03事件与下一步动作
各步骤之间保持两到三周不做任何改动的运行期,否则各构成部分会混合成一个无法拆解的数字

「上线前」的基线测量是唯一无法事后补做的部分。三个数字只需要半天时间就能测出:完成一份结果要花多长时间、结果中有缺陷的比例、能促成客户回复的比例。没有这些数字,后续任何比较都只会变成对记忆的争论。

步骤之间留出间隔,不是为了让报告看起来更严谨,而是为了保持可控性。如果一次性上线之后效果低于预期,你将无法判断三项改动中究竟是哪一项没有起作用,下一步也只能靠猜。

为什么试点效果无法在规模化后复现

这种拆解方法也能解释最常见的失败情形:试点阶段效果明显,但推广到全公司后效果消失。在试点中,通常只有第一部分构成在起作用,第二部分只是有条件地存在,第三部分则完全不存在。

研究

大约95%的组织未能从生成式AI试点中获得可衡量的回报,而按需求定制开发的企业级AI工具中,只有5%能进入正式生产环境。作者给出的原因是「学习断层」:试点系统无法保留上下文,也不会根据反馈持续改进。

MIT Project NANDA,《The GenAI Divide: State of AI in Business 2025》,2025年7-8月。对300多个公开披露项目的系统性梳理、对52家组织的结构化访谈、对153位高管的问卷调查,时间为2025年1-6月 · nanda.media.mit.edu (PDF)

这是一份行业报告,不是同行评审研究,样本也并未说明是随机抽取的——很可能偏向那些愿意公开披露结果的公司。但其中描述的机制与本文的拆解相吻合:试点展示的是第一部分构成,而真正创造回报的是第二和第三部分,试点阶段通常不会搭建它们,因为这需要系统集成和明确的流程负责人。关于这一点,详见效果究竟产生在哪里的拆解

如何让效果数字变得可复现:四个步骤

01

上线前测量三个数字

完成一份结果所需时间、缺陷结果占比、促成回复的比例。这半天的工作事后无法补做。

02

逐项引入改动

先上线规则,再上线交付,最后上线事件。各步骤之间留出足够测量的间隔期。

03

按群体标注效果

分别针对新员工和资深员工、简单和复杂案例。这些群体的平均值不能代表其中任何一个群体的真实情况——这就是异质性效应(heterogeneous effects)。

04

描述构成,而不是总数

结果报告里应该有三行数字,而不是一行。一行数字无法在下一个流程中复现。

如果你的实施效果只用一个数字来表达,你就无法在第二个流程中复现它——而且你也不会知道原因。

关于自动化效果归因的常见问题

如何测量流程自动化的效果?

通过上线前后分别测量的三个独立流程指标(process metrics):单位结果耗时、缺陷结果占比、进入下一步的结果占比。单一的综合效率指标是不够的——它会掩盖时间缩短但缺陷率上升(或相反)这类情况。

如果没有做「上线前」的基线测量该怎么办?

依据文档而不是记忆来还原它。取实施前一段时期的二十份结果:创建和发送日期能反推出耗时,内容本身能反映缺陷比例,往来记录能反映促成回复的比例。这种方式不如直接测量精确,但可以核实,而员工的回忆无法核实。

为什么我们的效果比案例中描述的要小?

很可能是构成部分的组合不同。如果你原本就有记录系统,而结果也一直会进入其中,那么第二部分构成的贡献就是零——这一块你早已具备。如果流程在发送结果之后没有下一步动作,第三部分构成的贡献也会是零。这样就只剩下第一部分,总体效果自然会明显逊色。

拆解为三个构成部分这种方法有多大的代表性?

这只是对一家公司某一个流程的拆解,不是一个普适模型。构成部分的数量取决于具体流程:有的是两个,有的是五个。真正具有普遍性的要求是另一件事:构成部分必须多于一个,并且每一部分都要有各自的机制和各自的受益对象。如果拆解不出来,很可能是因为效果本身根本没有被测量过。

内部数字来源

「方案准备时间减少78%」这一数字以及服务的具体机制(按规则计算、图片自动填充、统一排版、必填模块、从交易卡片直接发送、打开与点击追踪、触发式邮件、按经理统计数据)均来自Alego.Digital自有产品的描述。这是作者所在公司的内部指标,未经独立第三方核实,仅作为机制说明使用,不代表行业水平。将总效果拆解为三个构成部分,是作者根据改动构成做出的事后重构:实施当时并未对每一部分构成分别进行测量。

外部资料来源
  1. Brynjolfsson E., Hitt L. M. Beyond Computation: Information Technology, Organizational Transformation and Business Performance. Journal of Economic Perspectives, 2000. aeaweb.org
  2. Brynjolfsson E., Li D., Raymond L. Generative AI at Work. NBER Working Paper 31161, 2023. nber.org
  3. Dell'Acqua F. et al. Navigating the Jagged Technological Frontier. Harvard Business School Working Paper 24-013, 2023. ssrn.com
  4. MIT Project NANDA. The GenAI Divide: State of AI in Business 2025, 2025. nanda.media.mit.edu