AI落地

如何在AI应用场景上线前而非上线后计算其商业论证

2026年8月15日
如何在AI应用场景上线前而非上线后计算其商业论证

一个典型的AI应用场景商业论证(business case)是这样算的:一名员工完成某项任务需要两小时,工具二十分钟就能做完,省下一百分钟,再乘以任务数量和时薪。得出的数字看起来很可观——但几乎总是错的。

它错的原因不在算术,而在计量单位本身。省下的一小时并不是被腾出来、原地待命的资源:它会被别的工作重新填满,一部分要花在校验和修改结果上,有时干脆消失在没人核算过的更高产出预期里。真正应该进入商业论证的,是不会自行"长回来"的那部分——被消除的操作步骤和被消除的失败。

一句话总结

AI应用场景的商业论证建立在三个数字之上:流程中消失了多少操作步骤、目前有多大比例的结果存在失败,以及一次失败的成本是多少。节省的时间只能打折计入,折扣用于覆盖校验开销和返工——独立调查显示这个比例高达百分之四十。一个没有被消除的操作步骤、失败率也没有下降的应用场景,不管演示时的提速看起来多么惊艳,都收不回成本。

~40%节省下来的时间被用于修正和校验
六分之一使用AI完成的任务反而比以前耗时更长
72%的高管用某种指标追踪AI带来的回报

为什么省下的一小时不等于财务收益

这个判断有两条各自独立的依据,而且都可以在自己的公司里用一周的观察验证,不需要供应商配合,也不需要试点。

这一小时会流回流程里。腾出来的时间不会自动变成成本下降:它会被之前一直被搁置的任务填满。这本身可能是好事——团队终于有时间处理那些一直排不上号的工作了。但它不是利润表上的一行数字,不能当作既定收益向董事会汇报。

一部分时间花在了校验上。快速得到的结果仍然需要被阅读、核对,常常还要重写。这项工作是全新的:以前不存在,因为结果的生产者同时就是它的校验者。它在演示环节看不见,而是在实际使用的第二周才冒出来,等到有人必须为结果签字负责的时候。

研究

借助AI节省下来的时间中,约有40%会以返工的形式流回来:修正错误、重写、校验产出。换算下来,每"节省"十个小时,大约有四个小时要花在把结果打磨到可用的状态上。

Workday与Hanover Research联合发布,《Beyond Productivity: Measuring the Real Value of AI》报告,2026年1月。调查对象为3,200名高管与员工,来自年营收超过1亿美元、员工超过150人的企业,覆盖三个地区;调查执行于2025年11月 · newsroom.workday.com

这里的局限性由我自己指出:这项研究由一家企业软件供应商委托完成,该供应商销售自有的内嵌AI功能,天然有动机把"通用型"工具的问题放大。完整的研究方法只能通过填写表单才能获取,并非公开可查。我把这个数字当作折扣系数的量级参考,而不是可以直接套进测算表里的标准值。

研究

使用AI完成的任务中,大约有六分之一反而比以前更耗时。作者明确说明尚未确定原因:既可能是工作量本身增加了,也可能是校验时间增加了。

Epoch AI与Ipsos联合调查,2026年8月。基于Ipsos KnowledgePanel概率样本小组,调查了1,106名美国在职成年人,执行时间为2026年7月10日至19日;评估了十项典型的知识型工作任务 · epoch.ai

这是关于时间的自我报告,不是秒表实测,作者也明确表示没有建立因果关系——他们对此很坦诚。对商业论证而言,重要的是这个事实本身:效果的分布存在明显的负向长尾,如果只按供应商给出的平均承诺来计算,这条长尾根本不会被计入。

省下来的时间不是钱。真正变成钱的,只有被消除的操作步骤和没有发生的失败。

支撑这套计算的三个数字

一份诚实的商业论证所需要的一切,都可以在一到两天内直接从流程里采集出来,不需要试点,也不需要供应商在场。

消失的操作步骤数量。不是"会变快",而是"这一步以后不存在了"。当一个操作的结果可以按规则算出、自动带入,或者干脆不再需要时,它就消失了。每消失一个操作步骤,同时买到两样东西:时间,以及少一个可能失败的点。

目前结果中的失败率。失败不是文字上的一个错别字,而是一个让工作没能推进到下一步的事件:文件不完整就发出去了,申请没能送到该处理的人手上,款项打错了地方。这个比例需要人工翻查最近二十到五十份结果来统计。

一次失败的成本。由修正成本和损失概率两部分构成。第二部分不好算,因为它需要估计而不是查账单——但恰恰是这一部分,通常占了成本的大头。

数字如何采集它在计算中的作用
被消除的操作步骤逐步走一遍流程,标出哪些步骤会消失节省中稳定可靠的部分
结果中的失败率人工核查最近20~50份结果计算收益的基础
一次失败的成本修正成本加上损失概率通常超过时间节省的乘数
节省的时间前后对比测量需打折计入
新增的校验工作估计需要修改的结果占比从节省额中扣除

请特别注意最后一行。对结果的校验工作是引入前流程里并不存在的一项新增成本,而它几乎从来不会被计入最初的测算。正是这一项,把承诺的百分比变成了第三个月的失望。

那些已经在测算的人怎么说

研究

72%的受访高管表示,他们用某种指标追踪生成式AI带来的回报,其中四分之三报告回报为正。这项研究的一位作者明确要求读者对这个结果保持谨慎:这是自我报告,不是经过审计的公司财务数据。

Wharton(Stefano Puntoni、Prasanna Tambe)与GBK Collective联合发布,《2025 AI Adoption Report》,2025年11月。这是一项纵向研究的第三轮:调查对象为美国年营收超过5000万美元、员工超过1,000人的企业中800余名高层管理者,调查执行于2025年10月 · knowledge.wharton.upenn.edu

这条保留意见是作者自己提出的,这种坦诚并不常见,值得单独指出:他们建议读者对自己给出的数字"保持一定程度的怀疑",因为数据没有经过公司财务报表的验证。这项研究真正有用的结论并不在于那个百分比,而在于近三分之一的企业根本没有追踪任何回报——也就是说,它们连测算下一个应用场景的基准都没有。

什么时候正确的选择是推迟

"净现值为正就上马"这条标准准则,在高不确定性的项目里表现很差。针对IT投资,学术文献早已把这一点讲清楚了,而且结论有些反直觉。

研究

对于一项高不确定性、且可以选择推迟进入的IT投资,传统的净现值为正准则可能会给出错误的决策。在作者分析的案例中,把进入时间推迟三年产生的价值高于立即投资:比"现在就上马"多出152,955美元

Michel Benaroch(雪城大学,Syracuse University)、Robert J. Kauffman(明尼苏达大学,University of Minnesota)。《A Case for Using Real Options Pricing Analysis to Evaluate Information Technology Project Investments》,Information Systems Research,1999年3月。将实物期权(real options)定价模型应用于一个真实的支付服务上线案例 · steveambler.uqam.ca(PDF)

这篇论文已经有四分之一个多世纪的历史,案例本身来自上世纪八十年代末的银行基础设施——这是它的局限,我直接点明,而不是回避不谈。但方法论框架能够精确地平移过来:当一项工具的成本正在快速下降、而不确定性又很高时,等待的权利本身就有可以量度的等待价值。对AI应用场景来说,这一点尤其成立,因为算力价格和模型能力的变化速度,比一次集成收回成本的速度快得多。

计算的顺序

商业论证是自下而上搭建的:从操作步骤和失败出发算到钱,而不是从承诺的百分比倒推回操作步骤。
01流程步骤:哪些会消失
02当前失败率与单次失败成本
03打折后的时间节省(计入校验成本)
04成本:集成、推理、运行成本
05决策:实施、推迟,还是用规则解决
上线之后,同样这三个数字会用真实数据重新计算,取代之前的估计

第五个节点包含一个通常被忽略的选项:用规则来解决问题。如果分析后发现,消失的操作步骤是确定且可计算的,那就根本不需要语言模型——这个选择我在另一篇文章里单独讨论。按照这套方法完整计算一遍,得出这个结论的频率,往往比提出预算的人预想的要高。

批预算前要问的四个问题

01

哪些步骤会彻底消失

不是"会变快",而是不再存在。如果找不到这样的步骤,节省就只体现在时间上——而时间会流回流程里。

02

目前结果中的失败率有多高

翻查最近二十份结果。这是唯一一个供应商演示给不出来的数字。

03

谁来校验、校验多少

新增的校验工作从一开始就要计入测算,而不是等到第三个月才发现。

04

如果我们再等半年,会失去什么

如果诚实的答案是"除了错过的那部分节省,什么都不会失去",那么推迟的代价可能比一次日后还要返工的集成更便宜。

一份商业论证如果全部收益都来自省下来的小时数,那它就不是一份测算,而是一句一年后没人能兑现的承诺。

常见问题

如何在上线前计算AI落地的投资回报率(ROI)?

依靠三个数字:流程中消失的操作步骤数量、目前结果中的失败率,以及一次失败的成本。节省的时间作为单独一行计入,并打上用于覆盖校验开销和返工的折扣——独立调查显示这个比例可达百分之四十。成本不只是许可证费用,还包括集成、运行成本以及对结果的校验工作。

在一个流程里,什么算作失败?

指工作形式上完成了,但结果没能推进到下一步的事件:文件不完整就发出去了,申请没能送到该处理的人手上,回复没有被记录进系统。失败和普通错误的区别在于,它造成的后果发生在它产生的地方之外,因此很少会出现在它发生所在部门的报表里。

要测算效果,需要先做试点吗?

就测算本身而言不需要。这三个数字都可以在不借助任何工具的情况下,从当前流程中直接采集:把步骤列出来,按最近的结果统计失败次数,一次失败的成本和财务部门一起估算。试点是为了回答另一个问题——有多大比例的结果需要修改——试点应该专门瞄准这个问题,而不是用来展示工具的能力。

为什么承诺的节省没有出现在利润表里?

因为节省下来的时间不会自己离开公司。它只能通过三条路径变成钱:减少外部采购的服务量,少招一个本来要招的人,或者在人手不变的情况下提高产出。如果这三个决定一个都没做,节省就只是一个描述性的数字——对员工来说是真实的,但在财务报表上看不见。

内部数字的来源

这套计算顺序(被消除的操作步骤、失败率、失败成本、打折后的时间节省)是我自己的一套方法,来自Alego.Digital在工作量估算方面的实践,以及中俄投资基金投资组合中的投资项目评估经验。这套方法在公司的正式文档里没有系统化的书面记录,本文是第一次把它写出来。文章中没有给出任何内部的具体数字指标:所有数字都来自外部来源,并注明了各自的方法。

外部资料来源
  1. Workday、Hanover Research。《Beyond Productivity: Measuring the Real Value of AI》,2026年1月(调查3,200名受访者,2025年11月)。newsroom.workday.com
  2. Epoch AI、Ipsos。《One in Five Workers Delegate Work to AI》,2026年8月(调查1,106名在职成年人,2026年7月)。epoch.ai
  3. Wharton、GBK Collective。《2025 AI Adoption Report》,2025年11月(调查800余名高管)。knowledge.wharton.upenn.edu
  4. Benaroch M., Kauffman R. J. A Case for Using Real Options Pricing Analysis to Evaluate Information Technology Project Investments. Information Systems Research, 1999. steveambler.uqam.ca
← 返回博客列表