Chain和Agent真正的分界,不是有没有Tool,而是谁决定下一步做什么
AH-0515从Telegram客服出发,讲了AI应用从Chain到Agent的变化。 这篇素材最有价值的地方,是没有把Agent写成“更高级的Chain”。 它真正改变的是: Decision Authority。 在Chain里,程序员提前决定步骤。 在Agent里,模型在运行时决定调用什么工具、以什么顺序、是否继续。 ## 1. Chain的优势不是“老”,而是确定性 固定流程: I
Chain和Agent真正的分界,不是有没有Tool,而是谁决定下一步做什么
AH-0515从Telegram客服出发,讲了AI应用从Chain到Agent的变化。
这篇素材最有价值的地方,是没有把Agent写成“更高级的Chain”。
它真正改变的是:
Decision Authority。
在Chain里,程序员提前决定步骤。
在Agent里,模型在运行时决定调用什么工具、以什么顺序、是否继续。
1. Chain的优势不是“老”,而是确定性
固定流程:
Input → Classify → Retrieve → Call API → Format → Output。
它看起来不性感,但有几个巨大优势:
- 路径可预测;
- 每一步可单测;
- 权限容易限制;
- 成本容易估;
- 出错容易定位;
- 审计清楚。
如果业务本身稳定,Chain可能比Agent更好。
Determinism is a Feature。
2. Agent的价值出现在“路径无法穷举”
用户说:
“我的钱包到了,但地址创建失败,还能换一个吗?”
它可能同时涉及订单、设备状态、技术问题、售后政策和创建流程。
如果每一种组合都预写if/else,流程会迅速膨胀。
Agent适合: 问题开放; 工具组合变化; 需要根据中间结果决定下一步; 路径数量太多。
LangChain当前官方文档也明确区分: Workflows有预定路径; Agents动态决定过程和工具使用。
3. 但Agent把错误从“代码错误”升级成“决策错误”
Chain错通常是: 某个条件写错; API失败; 数据格式错。
Agent还会新增: 选错工具; 调用顺序错; 误解用户; 权限过大; 重复调用; 不知道何时停止; 把不确定判断当事实。
所以Agent能力越强,治理要求越高。
4. 最实用的架构通常不是二选一
企业系统真正稳定的形态往往是:
Deterministic Shell + Agentic Core。
例如客服:
固定: 身份验证; 退款上限; 高风险操作审批; 日志; 最终提交。
Agent负责: 理解自然语言; 决定查哪些信息; 综合多个只读结果; 生成建议。
这比“所有事情都让Agent自己决定”更安全。
5. Read和Act必须分开
让Agent查: 订单; 设备; 知识库;
与让Agent: 退款; 改地址; 关闭账户; 发消息; 下单;
不是同一级权限。
因此工具按四层分:
Discover → Read → Propose → Act。
前两层可以更自动。
Act层根据金额、不可逆性、客户影响设置Human Gate。
6. Agent必须有Stop Condition
Agent循环如果没有明确终止条件,可能: 重复查询; 反复改答案; 烧token; 触发API限流; 重复产生副作用。
当前LangChain Agent文档也把“模型输出最终答案或达到迭代限制”作为Agent循环停止机制的一部分。
生产系统还应增加: budget; max tool calls; time limit; no-progress detection; human escalation。
7. Durable Execution不等于让Agent自由跑
LangGraph当前官方文档强调持久执行、checkpoint、human-in-the-loop和可恢复任务。
这说明长任务的正确方向不是: “让Agent永远自主。”
而是: 状态可保存; 副作用可幂等; 中断后不重复扣款/写入; 人可以在关键节点介入。
8. 什么时候优先Chain
规则稳定; 高频重复; 合规强; 输出格式固定; 成本敏感; 每一步都能明确验收。
9. 什么时候引入Agent
用户表达高度开放; 工具组合多; 中间结果会改变路径; 人工当前就在做复杂判断; 但动作本身仍能被权限和验收约束。
10. 产品机会:Decision Authority Map
把任何自动化流程画成:
Step → Decision Owner → Allowed Tools → Read/Write → Consequence → Human Gate → Evidence → Retry → Stop。
它能直接回答:
这里真的需要Agent吗?
Stop Rule
如果引入Agent以后: 错误更难复现; 成本更难预测; 权限面扩大; 人工审核反而更多;
就退回更确定的Workflow。
Agent不是自动化的终点。最好的架构,是把“自由决策”只放在真正需要自由的地方。
11. 决策权还要绑定“可解释失败”
Chain失败时通常能定位到某个节点。Agent失败时,如果只留下最终回答,很难知道是理解错、工具错、工具结果错还是政策判断错。因此生产Agent需要保留足够的decision trace:选择了什么工具、基于什么可见证据、哪个规则阻止/允许了动作。
这里的trace不是要求保存模型所有内部推理,而是保存可审计的外部决策事件。
12. Agent化之前先算“分支熵”
一个实用判断:流程的分支是否真的多到无法维护?如果只有3种输入、5个稳定动作,写清楚规则可能比引入Agent便宜得多。只有当组合数量持续增长、人工本身也需要根据中间结果探索时,动态决策才开始有价值。
13. V3应该比较三组
同一业务分别做Chain、Hybrid、Agent三个版本,比较任务完成率、错误类型、平均成本、P95延迟、人工介入和高风险误动作。不要只比较“Agent能不能完成”,而要比较它是否比更简单方案产生净收益。