少花78%时间,少犯95%错误:早于大语言模型十年的智能体流程
2016年,我们没有任何语言模型,没有智能助手,没有向量数据库,「智能体」一词也不是今天这个含义。当时有的是PHP、一套CRM,以及一个每天手工整理商业报价单的销售部门。
我们为这个部门搭建了一套内部系统——商业报价单生成器。它把报价单的制作时间缩短了78%,把已发送文档中的错误数量减少了95%。这正是今天人工智能试点项目在演示文稿上展示的数量级。区别只有一个:我们当时没有任何会写文字的东西。
真正带来效果的不是文本生成,而是三件事:报价单不再靠手工拼凑,不再带着缺漏发出,并且开始把事件重新写回系统。2026年的人工智能项目,成败恰恰卡在同样的地方——研究数据也证实了这一点。
一份商业报价单是如何做出来的
销售经理接到需求后开始整理文档。先打开价目表,用计算器算价格,有时甚至心算。再去产品库里找配图:产品库很大,检索逻辑是为仓库管理设计的,不是为销售设计的,挑出三张合适的照片,往往比写报价单正文还费时间。接下来在Word里排版,全凭经理个人手艺。做一份报价单,少则半小时,多则大半个工作日。
由此产生的缺陷并非偶然,而是可以列举出来的重复性问题。
算术错误。人工计算总会出错,区别只在于频率高低:折扣算错了基数,漏计了税款,搞混了计量单位。这类错误要么在开票环节才被发现,要么根本发现不了,直接从利润里扣掉。
条款不全。报价单上只有工时费,却漏掉了运费、安装费、按需定制的加价。客户往往是在做出决定之后才知道还有额外费用。接下来只有两种走向,都不好:要么公司自己补上差价,要么双方展开一场谈话,谈完之后信任已无法恢复。
缺少联系方式。文档发出时没有附上负责经理的电话和邮箱。有疑问的客户得自己去找该问谁,而其中一部分人根本不会去找。
配图问题。有人随手放产品库里第一张图,有人因为嫌麻烦干脆什么都不放。同一项服务,不同经理做出来的报价单,看起来像是两家不同公司的产品。
版式问题。每个人排版风格各异:字体、对齐方式、标题颜色都不统一。企业的视觉规范只存在于品牌手册里——也就是客户永远看不到的文档里。客户能看到的文档里,反而没有它。
| 缺陷 | 损失的是什么 | 谁会注意到 |
|---|---|---|
| 计算错误 | 交易利润或客户信任 | 财务部门——最后才发现 |
| 条款不全 | 交易或声誉 | 客户——在最糟的时刻发现 |
| 缺少联系方式 | 客户的咨询机会 | 无人察觉 |
| 配图随意 | 「专属定制」的观感 | 无人察觉 |
| 版式不统一 | 公司规模感和秩序感 | 无人察觉 |
| 制作耗时过长 | 高薪员工的工时 | 主管——表现为「销售不足」 |
请留意第三列。六个缺陷中有四个,公司内部无人察觉。只有客户能看到——而他们不会告知,只会不再回复。
为什么这不是文字问题
如果把上述问题列出来看,会发现没有一个缺陷跟措辞有关。问题出在拼装环节:经理在「客户提出需求」和「文档完成」之间要手工执行多少道工序,又有多少道工序可能出错。
销售人员真正用于销售本身的时间只占28%的工作时长。其余72%都花在了跟进交易、录入数据以及其他行政事务上。
这个数字之所以重要,不在于数字本身,而在于它十多年来被不同样本的多项研究反复印证。销售部门,大部分时间其实并不在做销售。而这「非销售」工作里成本最高的部分,就是手工拼装那些彼此几乎雷同的文档。
发送之后才暴露的三个断点
假设文档拼装无误,旅程后半段才刚刚开始,那里另有一套断点。
报价单没有送达。忘了添加附件,邮件进了垃圾箱,用私人邮箱发送结果被过滤掉。经理确信工作已经完成,客户确信自己被遗忘了。双方都不知道彼此的认知已经出现分歧。
报价单送错了人。名字写错,公司名张冠李戴,条款还留着上一笔交易的内容。这样一个错误,代价远高于省下的半小时:它等于告诉客户,他收到的是一份复制品,他只是排在队伍里的一个号码。
没有人知道接下来发生了什么。邮件发出后就是沉默。经理要么一周后盲目回访,要么干脆不回访。部门主管无法区分「客户没回复,是因为不感兴趣」和「客户没回复,是因为压根没打开邮件」。
最后一点看似细枝末节,直到你算清延迟的代价。
在客户询价后一小时内联系的公司,达成合格对话的比例几乎是一小时后才联系的公司的7倍,是延迟一天以上才联系的公司的60多倍。而在至少一个月内做出回应的公司中,平均响应时间为42小时,只有37%的公司能在第一小时内响应。
这项研究已有十五年历史,而这正是它的价值所在:十五年间技术几经更迭,这种依赖关系却始终未变。响应速度不是礼貌问题,而是一个独立于报价单本身质量、直接作用于转化率的乘数。
我们搭建了什么
第二版系统是这样运作的。计算交给系统完成:经理只需选择产品项,价格、折扣、税费和附加费用按规则自动代入,不再依赖记忆。配图与产品项绑定,自动从产品库调取。排版统一为一套模板——企业视觉规范内嵌在文档里,而不是游离在外。必填模块——负责人联系方式和完整条款——无法跳过:缺了它们,文档根本生成不出来。
发送直接在交易卡片里一键完成。邮件在三到五分钟内送达客户,文档自动归档到该笔交易下。系统随后跟踪邮件是否被打开、客户是否点击了其中的链接。这些事件会触发后续动作:客户打开了,系统发出一封邮件;三天内没打开,发出另一封。如果邮件完全没被打开或进了垃圾箱,经理会收到提醒,他需要做的不是「继续催单」,而是重新核查发送渠道。
系统还单独积累统计数据:按经理维度,以及哪些报价单需求更高。
在这套架构里,文本生成反而是最简单的部分。真正创造价值的是规则和事件。
数字上发生了什么变化
剩余5%的错误,通常是系统原本就无法核查的部分:对客户需求理解有误,或输入环节选错了产品项。凡是能够被规则化的部分,都已经规则化,不再出错。
2026年:同一个错误出现在新的层面上
今天的人工智能试点项目,结构像得令人尴尬。团队在评测集(evals,用于检验模型的一组基准任务)上衡量回答质量,争论提示词写法,在不同模型之间做选择,展示一个智能体的回答优于真人员工的演示。演示很成功,流程却没有变化。
约95%的企业生成式人工智能试点项目,在损益表上没有产生可衡量的效果。作者给出的核心结论是:原因不在模型本身。「规模化的主要障碍不是基础设施,不是监管,也不是人才,而是可学习性:大多数生成式人工智能系统不会保留反馈,不会适应上下文,也不会随时间改进。」
再读一遍关于反馈的那句话。它描述的正是我们在2016年弥合的那道断层,只是换成了2025年的说法。一个不能保留事件、不能把事件写回系统的系统,无论内部模型多么智能,都只能停留在演示阶段。
超过40%的智能体人工智能(agentic AI)项目将在2027年底前被取消。原因包括:成本不断攀升、商业价值不清晰、风险管控不足。在数千家自称「智能体」的供应商中,真正具备相应能力的只有约130家——其余的,分析师称之为「agent washing」,即对助手、RPA和聊天机器人的重新包装。
这两项研究出自不同的人、不同的方法,说的却是同一件事。效果——或者说效果的缺失——由三件事决定,没有一件跟回答质量有关:
- 结果是否进入了记录系统(system of record,企业中承载交易、文档或客户真实状态的系统),还是停留在一个第二天没人再打开的聊天窗口里;
- 是否产生了一个能写回系统并触发下一步动作的事件——在错误代价高的场景里,是否有人在回路(human-in-the-loop,由人来批准或否决决策的机制)中把关;
- 回路内部发生了什么是否可见:不是「团队感觉不错」,而是按人员、场景和失败情况给出的具体数字。
断层,是指工作形式上已经完成、但结果没有传递下去的地方。2016年,它是没带附件的邮件、没算安装费的报价。2026年,它是智能体给出的完美回答,却哪里都没有记录,也没有通知任何人。
启动一个人工智能流程之前要问的四个问题
断点在哪里
现在真正出问题的是什么:质量、拼装、送达,还是反馈?如果质量不是主要问题,模型解决的就不是这个问题,而是另一个问题。
结果会流向哪里
流向团队真正在用的系统,还是流向一个必须记得打开的独立窗口?
之后会发生什么
会产生什么事件,谁来针对这个事件采取下一步行动。如果答案是「经理自己会去看」,那就说明根本没有事件。
一个月后你能看到什么
有哪些数字是你可以打开并对比的。如果只有感觉,效果就无从衡量。
如果四个问题里只解决了第一个,你在搭建的是一个演示。如果四个都解决了,你在搭建的是一个流程。
高频问题
大语言模型难道不会改变这一切吗?
它们确实改变了可以被自动化的任务范围:过去流程必须被严格形式化,现在不必了。但效果产生的位置没有变。模型扩大了「能做什么」的边界——它不能决定做出来的结果能不能到达系统,能不能到达那个人。
不用人工智能,能拿到同样的效果吗?
可以,而且这一步值得优先验证。按规则计算、必填字段、事件触发,这些都可以靠确定性自动化(而非模型)实现——更便宜,更可预测,也不会有「出了错该谁负责」的争议。合理的顺序是:先消除断点,再把模型加到那些确实离不开它的地方。
如果报价单目前还是手工制作,应该从哪里入手?
从一次测量开始:抽取最近发出的二十份文档,统计其中有多少存在数字错误、条款不全或联系方式缺失。这只需要一个小时,通常也就解决了优先级的争议——有缺陷的文档比例,往往比管理者预期的要高。
78%和95%这两个数字有多大参考价值?
这是一个产品在一个销售部门内部的指标,不是行业基准。把这两个数字直接套用到另一家公司没有意义。可以迁移的是背后的逻辑:它们源于消除断点,而不是源于打字速度。
「时间减少78%、错误减少95%」这两项指标,以及该系统的运作机制(按规则计算、必填模块、从交易卡片一键发送、打开与点击跟踪、间隔三天的触发邮件、未打开邮件的提醒、按经理维度的统计),均来自Alego.Digital自有产品的介绍资料,以及中俄投资基金投资组合中的该项目介绍。这些是作者所在公司的内部指标,未经独立第三方核实,仅作为机制说明,不构成行业参考基准。
- Salesforce. State of Sales(对38个国家7775名销售专业人士的调查,2022年8月—9月)。salesforce.com/news/stories/sales-research-2023
- Oldroyd J. B., McElheran K., Elkington D. The Short Life of Online Sales Leads. Harvard Business Review, 2011年3月。hbr.org/2011/03/the-short-life-of-online-sales-leads
- MIT NANDA. The GenAI Divide: State of AI in Business 2025, 2025年7月。State_of_AI_in_Business_2025_Report.pdf
- Gartner. Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027. 新闻稿,2025年6月25日。gartner.com