AI落地

少花78%时间,少犯95%错误:早于大语言模型十年的智能体流程

2026年8月15日
少花78%时间,少犯95%错误:早于大语言模型十年的智能体流程

2016年,我们没有任何语言模型,没有智能助手,没有向量数据库,「智能体」一词也不是今天这个含义。当时有的是PHP、一套CRM,以及一个每天手工整理商业报价单的销售部门。

我们为这个部门搭建了一套内部系统——商业报价单生成器。它把报价单的制作时间缩短了78%,把已发送文档中的错误数量减少了95%。这正是今天人工智能试点项目在演示文稿上展示的数量级。区别只有一个:我们当时没有任何会写文字的东西。

简述

真正带来效果的不是文本生成,而是三件事:报价单不再靠手工拼凑,不再带着缺漏发出,并且开始把事件重新写回系统。2026年的人工智能项目,成败恰恰卡在同样的地方——研究数据也证实了这一点。

−78%制作一份报价单所需时间
−95%已发送文档中的错误
3–5 分钟从经理点击到客户收到邮件

一份商业报价单是如何做出来的

销售经理接到需求后开始整理文档。先打开价目表,用计算器算价格,有时甚至心算。再去产品库里找配图:产品库很大,检索逻辑是为仓库管理设计的,不是为销售设计的,挑出三张合适的照片,往往比写报价单正文还费时间。接下来在Word里排版,全凭经理个人手艺。做一份报价单,少则半小时,多则大半个工作日。

由此产生的缺陷并非偶然,而是可以列举出来的重复性问题。

算术错误。人工计算总会出错,区别只在于频率高低:折扣算错了基数,漏计了税款,搞混了计量单位。这类错误要么在开票环节才被发现,要么根本发现不了,直接从利润里扣掉。

条款不全。报价单上只有工时费,却漏掉了运费、安装费、按需定制的加价。客户往往是在做出决定之后才知道还有额外费用。接下来只有两种走向,都不好:要么公司自己补上差价,要么双方展开一场谈话,谈完之后信任已无法恢复。

缺少联系方式。文档发出时没有附上负责经理的电话和邮箱。有疑问的客户得自己去找该问谁,而其中一部分人根本不会去找。

配图问题。有人随手放产品库里第一张图,有人因为嫌麻烦干脆什么都不放。同一项服务,不同经理做出来的报价单,看起来像是两家不同公司的产品。

版式问题。每个人排版风格各异:字体、对齐方式、标题颜色都不统一。企业的视觉规范只存在于品牌手册里——也就是客户永远看不到的文档里。客户能看到的文档里,反而没有它。

缺陷损失的是什么谁会注意到
计算错误交易利润或客户信任财务部门——最后才发现
条款不全交易或声誉客户——在最糟的时刻发现
缺少联系方式客户的咨询机会无人察觉
配图随意「专属定制」的观感无人察觉
版式不统一公司规模感和秩序感无人察觉
制作耗时过长高薪员工的工时主管——表现为「销售不足」

请留意第三列。六个缺陷中有四个,公司内部无人察觉。只有客户能看到——而他们不会告知,只会不再回复。

为什么这不是文字问题

如果把上述问题列出来看,会发现没有一个缺陷跟措辞有关。问题出在拼装环节:经理在「客户提出需求」和「文档完成」之间要手工执行多少道工序,又有多少道工序可能出错。

研究

销售人员真正用于销售本身的时间只占28%的工作时长。其余72%都花在了跟进交易、录入数据以及其他行政事务上。

Salesforce, State of Sales:对38个国家7775名销售专业人士的调查,2022年8月—9月 · salesforce.com

这个数字之所以重要,不在于数字本身,而在于它十多年来被不同样本的多项研究反复印证。销售部门,大部分时间其实并不在做销售。而这「非销售」工作里成本最高的部分,就是手工拼装那些彼此几乎雷同的文档。

发送之后才暴露的三个断点

假设文档拼装无误,旅程后半段才刚刚开始,那里另有一套断点。

报价单没有送达。忘了添加附件,邮件进了垃圾箱,用私人邮箱发送结果被过滤掉。经理确信工作已经完成,客户确信自己被遗忘了。双方都不知道彼此的认知已经出现分歧。

报价单送错了人。名字写错,公司名张冠李戴,条款还留着上一笔交易的内容。这样一个错误,代价远高于省下的半小时:它等于告诉客户,他收到的是一份复制品,他只是排在队伍里的一个号码。

没有人知道接下来发生了什么。邮件发出后就是沉默。经理要么一周后盲目回访,要么干脆不回访。部门主管无法区分「客户没回复,是因为不感兴趣」和「客户没回复,是因为压根没打开邮件」。

最后一点看似细枝末节,直到你算清延迟的代价。

研究

在客户询价后一小时内联系的公司,达成合格对话的比例几乎是一小时后才联系的公司的7倍,是延迟一天以上才联系的公司的60多倍。而在至少一个月内做出回应的公司中,平均响应时间为42小时,只有37%的公司能在第一小时内响应。

James B. Oldroyd, Kristina McElheran, David Elkington.「The Short Life of Online Sales Leads」,《哈佛商业评论》,2011年3月。审计2241家美国公司,分析42家公司的125万条询价记录 · hbr.org

这项研究已有十五年历史,而这正是它的价值所在:十五年间技术几经更迭,这种依赖关系却始终未变。响应速度不是礼貌问题,而是一个独立于报价单本身质量、直接作用于转化率的乘数。

这些缺陷,没有一个能靠把文档写得更好来解决。

我们搭建了什么

第二版系统是这样运作的。计算交给系统完成:经理只需选择产品项,价格、折扣、税费和附加费用按规则自动代入,不再依赖记忆。配图与产品项绑定,自动从产品库调取。排版统一为一套模板——企业视觉规范内嵌在文档里,而不是游离在外。必填模块——负责人联系方式和完整条款——无法跳过:缺了它们,文档根本生成不出来。

发送直接在交易卡片里一键完成。邮件在三到五分钟内送达客户,文档自动归档到该笔交易下。系统随后跟踪邮件是否被打开、客户是否点击了其中的链接。这些事件会触发后续动作:客户打开了,系统发出一封邮件;三天内没打开,发出另一封。如果邮件完全没被打开或进了垃圾箱,经理会收到提醒,他需要做的不是「继续催单」,而是重新核查发送渠道。

系统还单独积累统计数据:按经理维度,以及哪些报价单需求更高。

这是一个闭环,不是流水线:每一步的结果都会写回系统,并触发下一步。
01交易卡片
02按规则计算与拼装
03送达
04事件:已打开/未打开
05下一步与提醒
反馈会写回交易卡片,并计入部门统计

在这套架构里,文本生成反而是最简单的部分。真正创造价值的是规则和事件。

数字上发生了什么变化

商业报价单制作流程自动化后的各项指标。浅色轨道代表实施前的水平,记为100%。

剩余5%的错误,通常是系统原本就无法核查的部分:对客户需求理解有误,或输入环节选错了产品项。凡是能够被规则化的部分,都已经规则化,不再出错。

2026年:同一个错误出现在新的层面上

今天的人工智能试点项目,结构像得令人尴尬。团队在评测集(evals,用于检验模型的一组基准任务)上衡量回答质量,争论提示词写法,在不同模型之间做选择,展示一个智能体的回答优于真人员工的演示。演示很成功,流程却没有变化。

研究

95%的企业生成式人工智能试点项目,在损益表上没有产生可衡量的效果。作者给出的核心结论是:原因不在模型本身。「规模化的主要障碍不是基础设施,不是监管,也不是人才,而是可学习性:大多数生成式人工智能系统不会保留反馈,不会适应上下文,也不会随时间改进。」

MIT NANDA,《The GenAI Divide: State of AI in Business 2025》,2025年7月。52次结构化访谈,153名高管调查,梳理300多个公开披露的项目案例,2025年1月—6月 · 完整报告(PDF)

再读一遍关于反馈的那句话。它描述的正是我们在2016年弥合的那道断层,只是换成了2025年的说法。一个不能保留事件、不能把事件写回系统的系统,无论内部模型多么智能,都只能停留在演示阶段。

预测

超过40%的智能体人工智能(agentic AI)项目将在2027年底前被取消。原因包括:成本不断攀升、商业价值不清晰、风险管控不足。在数千家自称「智能体」的供应商中,真正具备相应能力的只有约130家——其余的,分析师称之为「agent washing」,即对助手、RPA和聊天机器人的重新包装。

Gartner,新闻稿,2025年6月25日。Anushree Verma,高级分析总监:「目前大多数智能体人工智能项目还处于早期实验或原型阶段,主要由炒作驱动,且经常被用错场景。」 · gartner.com

这两项研究出自不同的人、不同的方法,说的却是同一件事。效果——或者说效果的缺失——由三件事决定,没有一件跟回答质量有关:

  • 结果是否进入了记录系统(system of record,企业中承载交易、文档或客户真实状态的系统),还是停留在一个第二天没人再打开的聊天窗口里;
  • 是否产生了一个能写回系统并触发下一步动作的事件——在错误代价高的场景里,是否有人在回路(human-in-the-loop,由人来批准或否决决策的机制)中把关;
  • 回路内部发生了什么是否可见:不是「团队感觉不错」,而是按人员、场景和失败情况给出的具体数字。
自动化真正带来收益的地方,不是它节省了时间,而是它补上了断层。

断层,是指工作形式上已经完成、但结果没有传递下去的地方。2016年,它是没带附件的邮件、没算安装费的报价。2026年,它是智能体给出的完美回答,却哪里都没有记录,也没有通知任何人。

启动一个人工智能流程之前要问的四个问题

01

断点在哪里

现在真正出问题的是什么:质量、拼装、送达,还是反馈?如果质量不是主要问题,模型解决的就不是这个问题,而是另一个问题。

02

结果会流向哪里

流向团队真正在用的系统,还是流向一个必须记得打开的独立窗口?

03

之后会发生什么

会产生什么事件,谁来针对这个事件采取下一步行动。如果答案是「经理自己会去看」,那就说明根本没有事件。

04

一个月后你能看到什么

有哪些数字是你可以打开并对比的。如果只有感觉,效果就无从衡量。

如果四个问题里只解决了第一个,你在搭建的是一个演示。如果四个都解决了,你在搭建的是一个流程。

高频问题

大语言模型难道不会改变这一切吗?

它们确实改变了可以被自动化的任务范围:过去流程必须被严格形式化,现在不必了。但效果产生的位置没有变。模型扩大了「能做什么」的边界——它不能决定做出来的结果能不能到达系统,能不能到达那个人。

不用人工智能,能拿到同样的效果吗?

可以,而且这一步值得优先验证。按规则计算、必填字段、事件触发,这些都可以靠确定性自动化(而非模型)实现——更便宜,更可预测,也不会有「出了错该谁负责」的争议。合理的顺序是:先消除断点,再把模型加到那些确实离不开它的地方。

如果报价单目前还是手工制作,应该从哪里入手?

从一次测量开始:抽取最近发出的二十份文档,统计其中有多少存在数字错误、条款不全或联系方式缺失。这只需要一个小时,通常也就解决了优先级的争议——有缺陷的文档比例,往往比管理者预期的要高。

78%和95%这两个数字有多大参考价值?

这是一个产品在一个销售部门内部的指标,不是行业基准。把这两个数字直接套用到另一家公司没有意义。可以迁移的是背后的逻辑:它们源于消除断点,而不是源于打字速度。

内部数字的出处

「时间减少78%、错误减少95%」这两项指标,以及该系统的运作机制(按规则计算、必填模块、从交易卡片一键发送、打开与点击跟踪、间隔三天的触发邮件、未打开邮件的提醒、按经理维度的统计),均来自Alego.Digital自有产品的介绍资料,以及中俄投资基金投资组合中的该项目介绍。这些是作者所在公司的内部指标,未经独立第三方核实,仅作为机制说明,不构成行业参考基准。

外部信息来源
  1. Salesforce. State of Sales(对38个国家7775名销售专业人士的调查,2022年8月—9月)。salesforce.com/news/stories/sales-research-2023
  2. Oldroyd J. B., McElheran K., Elkington D. The Short Life of Online Sales Leads. Harvard Business Review, 2011年3月。hbr.org/2011/03/the-short-life-of-online-sales-leads
  3. MIT NANDA. The GenAI Divide: State of AI in Business 2025, 2025年7月。State_of_AI_in_Business_2025_Report.pdf
  4. Gartner. Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027. 新闻稿,2025年6月25日。gartner.com
← 返回博客列表