先定规则,再选模型:如何在自动化与人工智能之间做出选择
在我们的报价单生成器中,价格计算既不是人做的,也不是模型做的,而是规则做的:产品条目、折扣、税费、附加成本,全部按表格代入计算。规则不会算错算术,不会到周五就疲惫,也不会编造出价目表里没有的条目。
这是系统里最枯燥的部分,却恰恰贡献了大部分效果。在选择工具之前,值得先问一个问题:这项任务是否存在一个可以写成规则的唯一正确答案?答案不仅决定了实施成本,还决定了出错时由谁负责。
这条界线不取决于任务的复杂程度,而取决于正确答案的性质。如果正确答案只有一个,并且可以写成规则,这项任务就应该交给确定性自动化(deterministic automation)来完成:更便宜、可复现,责任也更清晰。只有当可接受的答案不止一个、需要靠理解和判断来取舍时,才需要语言模型。这两类任务可以在同一个流程里混合使用,但前提是二者之间有清晰的边界。
不该交给模型处理的三个任务特征
判断一项任务适合什么方案,可以用三个问题来检验,而且三个问题都应该在选择供应商之前回答。每一个问题都能筛掉一整类原本会被引向昂贵路径的项目。
正确答案唯一且可验证。 在给定条目和折扣的情况下,订单金额只有一个正确数值。截止日期只有一个。交易对手是否存在强制执行程序,答案要么是,要么否。在这类任务上,模型带来的不是质量提升,而是波动:它可能给出正确答案,也可能给出一个看似合理的答案。规则在相同输入下始终给出相同结果,这是它的核心特性,而不是局限。
错误有明确的代价和责任人。 计算错误会侵蚀利润,期限错误会招致罚款,信息错误会导致款项打错账户。当规则出错时,排查只需几分钟:打开规则、读懂逻辑、修正它,之后同样的错误不会再发生。当模型出错时,排查往往卡在一个没有简单答案的问题上——这一次它为什么给出了不同的回答。
重复执行需要得到相同结果。 发给客户的内部文档、给管理层的报告、记录系统(system of record)里的条目——凡是结果需要与此前对比的场景,可复现性(reproducibility)比灵活性更重要。两个相似的请求应当得到两个相同的答案,否则讨论的焦点会变成两者为何不同,而不是工作本身。
| 需要完成的任务 | 用什么解决 | 谁对错误负责 |
|---|---|---|
| 按价目表和折扣计算价格 | 规则 | 规则的制定者——错误可复现 |
| 按登记名录核查交易对手 | 规则加系统集成 | 集成的负责人 |
| 禁止在缺少联系方式时发送文档 | 必填字段 | 无人——发送本身就无法完成 |
| 为预算条目撰写说明文字 | 模型 | 审核通过该文本的人 |
| 解析来信的含义与诉求 | 模型 | 审批流程中的人 |
| 根据来件内容选择回复模板 | 带护栏机制(guardrails)的模型 | 流程负责人——按错误选择的比例问责 |
第三列比前两列更重要。在确定性部分,责任落实到具体人、可以精确定位;在概率性部分,责任是分散的,需要单独的机制来承担。凡是在起步阶段没有回答这个问题的项目,后来往往正是卡在这一点上。
还要说明这个判断标准解决不了什么。它并不能回答是否需要自动化本身:一个只有一个正确答案的任务,可能一个季度才执行一次,根本不值得投入一小时的开发。它也不能省去这项工作中最难的部分——搞清楚规则到底是什么。在我们的项目里,把价格计算规则梳理清楚所花的时间,比把它写成代码还要长:我们发现三位经理对折扣该按哪个基数计算,各有各的理解,而在系统上线之前,这个问题从未被暴露出来。
这是一个典型的发现。那些「大家都心知肚明」的规则,一旦真正落笔去写,往往会分裂成几个互相矛盾的版本——仅仅是这个梳理过程本身,就已经产生了价值,无论最终这项任务用什么方式解决。
为什么AI试点项目难以转化为利润
演示效果与实际收益之间的落差,已经被多个独立机构测算过,尽管方法各异,但结论的方向是一致的。
在投资企业级生成式AI的机构中,约有95%没有获得可衡量的回报。作者认为,原因不在于模型质量,而在于落地方式本身:这些系统无法保留反馈、无法适应具体场景,也不会随时间改进。
关于这份报告,有必要单独说明。它被媒体广泛引用,但在转述过程中,样本参数经常被扭曲——52场访谈和153位受访高管这两个数字,在转述中变成了别的数字。核实这份报告应该直接看PDF原文,而不是看关于它的新闻报道;而且报告本身并没有把生成式AI与确定性自动化做对比——这个类比是我做出的,不是报告作者的观点。
只有39%的企业认为AI对经营利润产生了某种可衡量的影响,而其中大多数企业的这一影响幅度不到EBIT的5%。约三分之二的机构尚未开始在全公司范围内推广AI。
这里的局限性很明显,是我自己指出的,而不是文章的批评者指出的:这是高管的自我报告,而进行这项调查的公司本身也在销售AI落地方面的咨询服务。方法和样本都公开透明,因此这个数字可以引用——但应把它看作市场参与者对自身情况的陈述,而不是一种客观测量。
在AI出现之前,确定性自动化的成本是多少
规则自身也有一段可以量化的历史,而这段历史恰好可以作为参照系。流程机器人(RPA)当年落地的场景——文件流转、后台办公、申请处理——正是今天语言模型试图进入的地方。
74%的受访企业已经实施了流程机器人,而那些真正把项目落地见效的企业,平均报告的成本削减幅度为32%。与此同时,同一份报告显示,平均投资回收期从16个月延长到了22个月。
这份资料已经有四年历史,这是有意为之的选择:我需要的是生成式AI热潮之前、关于规则型自动化成熟度的结构性事实,而不是最新的新闻。数据来自企业自我报告,没有经过独立审计;而投资回收期从16个月延长到22个月这一点也说明,规则同样有其局限——这份报告并没有粉饰情况。
确定性规则与模型如何在同一流程中协作
在实践中,选择很少是非此即彼的。在实际运行的系统里,这两类方案是并存的,价值来自二者之间清晰的边界,而不是谁战胜谁。
这个阶段顺序不是装饰性的。规则排在模型之前,是因为在为调用模型付出成本之前,先筛掉明显不完整的输入更划算。人在回路(human-in-the-loop,即由人来批准或拒绝决策的场景)应该设置在错误真正会造成经济损失的环节,而不是设置在看起来最吓人的环节。
还要单独说说测量。人工做出的修正,应当被回收进评测集(evals,即用来检验模型的一组基准任务)。否则半年之后,没有人能说清情况是变好了还是变差了——因为根本没有可比较的基准。
能节省预算的一套操作顺序
把流程拆解为一个个决策点
不是拆成步骤,而是拆成每一个做出选择的节点。对每个节点回答同一个问题:正确答案是唯一的,还是有多个?
把所有答案唯一的环节用规则解决
计算、校验、必填字段、按形式特征分流——这些都便宜,而且比挑选一家供应商还要快。
衡量剩下的部分
完成第一步之后,任务范围往往会大幅缩小——原本需要模型的五个环节,可能只剩一个,有时甚至一个都不需要。
为剩下的部分建立测量机制
评测集、人工修正比例、拒答比例。没有这三个数字,你分不清是真正变好了,还是只是运气好。
把模型直接架设在一个没有规则的流程之上,它会继承这个流程所有的缺陷,还会额外增加一个自己的问题:现在错误连复现都做不到了。
规则还是模型:常见问题解答
如何判断一项任务需要语言模型,还是用规则就够了?
只需问一个问题:这项任务的正确答案是唯一的,还是有多个可接受的答案?计算、按名录核查、按形式特征分流——答案唯一,用规则。撰写文字、解析任意来信、根据来件含义选择应对方式——答案不止一个,用模型。如果这个问题回答不了,说明任务本身的定义还不够清晰,还不具备自动化的条件。
确定性自动化是不是已经过时了?
没有,变化的是分工方式。过去必须把整个流程完全形式化,否则就无法自动化,这就把大多数任务挡在了门外。现在只需要把可验证的部分形式化,无法形式化的部分交给模型处理。可自动化的范围扩大了,但对计算结果可复现性的要求没有变。
业务流程中模型出错,该由谁负责?
由界定其应用边界的人,以及审批结果的人负责。具体来说包含三件事:明确流程负责人,规定哪些节点必须由人审批决策,并持续统计错误率、设定触发暂停的阈值。如果这三件事一件都没做,那责任就不是分散的,而是根本没有分配。
如果AI预算已经批下来了,应该从哪里入手?
从盘点某一个流程里的决策点入手,而不是从挑选平台入手。选一个人工工作量最大的流程,列出其中所有的决策节点,把它们标记为答案唯一或答案不唯一。通常会发现四分之三的节点答案是唯一的,这样预算就可以更合理地分配:大部分投入规则和系统集成,小部分留给剩余环节中的模型。
按规则计算价格、必填模块以及从交易卡片直接发送的机制,来自Alego.Digital自有产品(报价单生成器)的说明文档。按强制执行程序登记名录核查交易对手、通知负责人并将结果写入CRM的流程,来自同一时期另一款自有产品的说明文档。这些均为作者所属公司的内部资料,未经独立第三方核实,仅作为机制说明使用。图示中的混合流程示例是对实践的概括,并非对某一具体项目的描述。
- MIT Project NANDA. The GenAI Divide: State of AI in Business 2025,2025年8月。 nanda.media.mit.edu
- McKinsey & Company (QuantumBlack). The State of AI: Global Survey,2025年11月5日。 mckinsey.com
- Deloitte. Automation with intelligence: 4th Global Intelligent Automation Survey,2022年。 deloitte.com