Fable 5 真正值得学的不是“放着让它自己跑”:长周期 Agent 要先写目标、预算、记忆和停止条件
这篇源素材有一个判断是对的: 到了 Fable 5 这一代,继续只用“问一句、答一句”的方式,确实会浪费一部分长周期 Agent 能力。 但如果把另一端理解成: “把活甩给它,它自己一直做,干完回来找你。” 又会走向另一个极端。 重新核对 Anthropic 2026 年 Fable 5 的官方资料以后,更准确的变化不是“AI 终于可以完全撒手不管”,而是: 模型更能维持长任务、调用工
Fable 5 真正值得学的不是“放着让它自己跑”:长周期 Agent 要先写目标、预算、记忆和停止条件
这篇源素材有一个判断是对的:
到了 Fable 5 这一代,继续只用“问一句、答一句”的方式,确实会浪费一部分长周期 Agent 能力。
但如果把另一端理解成:
> “把活甩给它,它自己一直做,干完回来找你。”
又会走向另一个极端。
重新核对 Anthropic 2026 年 Fable 5 的官方资料以后,更准确的变化不是“AI 终于可以完全撒手不管”,而是:
> 模型更能维持长任务、调用工具、并行子任务和自我检查,因此我们更需要一套长周期任务治理合同。
能力变强以后,真正稀缺的不是 Prompt,而是目标、验收、预算、权限、记忆和停止条件。
一、先确认模型身份:Fable 5 不是社交媒体杜撰名
这一点必须先核。
Fable 5 是 Anthropic 2026 年正式公开的模型,官方定位确实强调复杂推理、长周期 agentic work、视觉以及更强的多步任务能力。
所以源文把它从“聊天模型”拉向“长周期执行模型”,方向成立。
但这里要分清两层:
模型能力
推理、视觉、长上下文、规划、工具选择、subagent 协调等。Harness 能力
Claude Code 里有哪些 slash command、能调用哪些工具、能不能访问浏览器/电脑、有哪些权限、怎样持久化 memory、怎样运行子 Agent。Model Capability ≠ Harness Feature。
一个模型视觉更强,不代表它天然拥有桌面控制权。
一个模型适合长任务,也不代表 Claude Code 当前一定存在某个你在 X 上看到的命令。
这是本条最重要的第一处纠错。
二、/goal、/loop 这种命令,必须过 Command Existence Gate
源文很谨慎地写:
> 据说有 /goal 和 /loop,具体语法请在 /help 自己确认。
这句话本身说明作者没有闭环 CLI 层证据。
当前官方 Claude Code CLI/command 文档里,不能把这两个命令当成已验证的标准入口。
因此 alphahole 以后碰到任何:
/xxx
--flag
环境变量
配置键
API endpoint
都不能因为“看起来合理”就写进教程。
统一过:
Command Existence Gate
Official Reference → Current Version → Exact Syntax → Scope → Permission → Deprecation / Replacement → Verified Date。
如果官方没有,就标:
SOURCE_UNVERIFIED
或者
COMMUNITY / CUSTOM COMMAND
而不是让读者自己踩坑验证。
三、长周期 Agent 的核心不是 Loop,而是 Goal Contract
假设你要让 Agent 连续做 30 分钟、2 小时甚至更久。
最糟糕的指令是:
> “一直研究,直到做好为止。”
因为“做好”没有定义。
一个成熟的任务应该先写:
Goal
最终解决什么问题?Acceptance
什么状态才算完成?Evidence
哪些事实必须有来源闭环?Boundaries
哪些不能做?Budget
最多花多少时间、Token、API/搜索/外部调用?Checkpoints
什么情况下必须停下来报告?Stop
什么时候应该承认做不到、换路径或终止?这就是:
> Long-Horizon Agent Contract
不是为了束缚 Agent。
而是为了让它有一个不会无限漂移的轨道。
四、“让它一直跑”最容易产生的是 Task Drift
长任务最大的风险未必是明显报错。
而是:
它一直在工作,但慢慢偏离了你真正要解决的问题。
典型 Task Drift:
- 查到很多相关资料,却没有回答核心问题;
- 为了补齐形式,不断扩大范围;
- 一个失败方案反复换表达重试;
- 为了“完成任务”降低证据标准;
- 自己生成更多子任务,成本不断膨胀;
- 把临时假设写进长期记忆,后面继续污染判断。
所以长任务一定要有:
Checkpoint Contract
例如:
> 每完成一个证据层,先检查是否改变核心判断; > 如果连续两轮搜索没有新增高价值证据,停止扩展; > 如果关键依赖无法访问,标记 dependency missing,而不是继续猜。
这比“每 30 分钟循环一次”更重要。
五、Budget 不是省钱参数,是控制面
源文提出一个“10% 高级模型规划 + 80% 便宜模型执行 + 10% 高级模型验收”的杠铃策略。
这个比例可以作为作者个人工作流经验。
但它不是通用规律。
真正应该抽象的是:
> 任务不同阶段的错误成本不同,因此模型预算应该按判断价值分配,而不是平均分配。
可以建立:
Model Allocation Gate
High-consequence reasoning → stronger model
Mechanical transform → cheaper model if eval passes
Final high-impact review → stronger model / human review
但要注意一个常见误区:
所谓“粗活”并不一定低风险。
例如:
- 批量删除文件;
- 改数据库;
- 生成医疗/金融结论;
- 大规模发邮件;
- 重复研究;
- 上下文不同步;
- 冲突结论;
- 证据重复;
- 汇总损失;
- Token 膨胀;
- 权限边界扩大。
步骤机械,但后果很高。
所以预算模型真正看:
Cognitive Difficulty × Consequence × Eval Coverage
而不是简单 10/80/10。
六、Subagent 不是越多越好
Fable 5 的官方定位确实支持更复杂的 agentic/subagent 工作。
但“能开多个分身”不代表每个复杂任务都应该拆成十几个 Agent。
Subagent 有额外成本:
所以先问:
任务是否真的可以并行?
最适合拆:
- 不同来源独立核验;
- 不同假设并行反证;
- 不同模块互不依赖。
不适合拆:
- 高度共享上下文;
- 一个判断依赖上一步;
- 最终责任无法分割。
增加一个:
Subagent Decomposition Gate
Independent? Shared Context? Merge Cost? Conflict Resolution? Permission Scope? Budget?
如果 merge cost 高于并行收益,就不要拆。
七、Skills 的正确价值:不是“教一次永远会”
源文把 Skill 解释成:
> 教一次,以后一直会。
这对新手好理解,但会制造错误期待。
Skill 更准确是:
> 一个可版本化、可触发、可测试的任务协议。
它应该写:
Trigger / Anti-trigger / Inputs / Workflow / Permissions / Human Gate / Output / Acceptance / Failure / Examples / Evals / Version。
而且 Skill 不是天然正确。
业务变化、模型更新、工具改版以后,它可能失效。
所以 Skill 的真正循环是:
Correction → Hypothesis → Rule Change → Regression Eval → Release。
这和 alphahole 已有 Experience-to-Skill Compiler 完全一致。
八、“把上千条同行内容喂进去模仿”必须加 Rights + Originality Gate
源文建议,把同赛道博主大量推文喂给模型,让它学习语气、思路、结构。
这一步不能简单写成“最高价值的一招”。
可做的是:
- 提取高层内容类型;
- 研究主题分布;
- 研究信息架构;
- 研究公开传播信号;
- 提取抽象结构规律。
- 模仿某个人独特口吻到高度近似;
- 复制专有案例;
- 改几个词重新发布;
- 用大量作品训练出明显可识别的仿写人格。
不应该做的是:
因此必须经过:
Style-to-Rules Gate
Source → Rights → Abstract Principle → Multi-source Comparison → Original Draft → Similarity Review。
真正可迁移的是规律,不是别人的表达指纹。
九、视觉能力也要区分“看懂”与“事实读取”
官方研究确实显示 Fable 5 视觉能力是这一代的重要升级点。
源文举出: 图表、UI、截图、设计、科研图、内容视觉等场景,方向合理。
但“能看图”不等于:
> 能从任何科研图精确抠出可靠数值。
图像读数还有:
- 分辨率;
- 坐标轴;
- 遮挡;
- 图例;
- 误差线;
- OCR;
- 视觉估读误差。
所以数据类图表要增加:
Visual Evidence Gate
What is visible? → Exact vs Estimated → Axis / Unit → OCR confidence → Cross-check with source table/data → Citation。
不能让“视觉很强”变成“截图就是数据库”。
十、官方 Pokémon 视觉案例反而说明:作者的谨慎判断需要动态更新
源文说:
> “网上流传它只靠画面通关宝可梦,我没在官方文档找到,引用前自己找。”
这是一个好的编辑习惯。
但到当前核验时点,Anthropic 后续官方研究材料已经有视觉任务/游戏相关实验说明。
这说明一个非常重要的编辑原则:
> 过去标为 UNVERIFIED 的说法,未来可能变成 VERIFIED,也可能被证伪。
所以 Claim Ledger 不是一次性判断。
它需要:
Claim → Status → Verified Date → Source → Supersede。
这正是 alphahole 长期资产与普通文章最大的区别。
十一、Memory:最危险的不是“忘记”,而是“记错了还一直用”
源文推荐建:
claude-context/
claude-memory.md
claude-instructions.md
然后让系统:
> 每次得到重要背景,就自动更新 memory。
这个思路非常适合个人 Agent OS,但必须加一道 Gate。
因为长期记忆有五种风险:
- 临时状态被永久化;
- 错误事实被记住;
- 敏感信息进入普通 markdown;
- 新结论出现后旧结论不失效;
- 不知道怎样删除。
所以从 Batch 28 开始,长期记忆写入统一走:
Memory Write Gate
Is it stable? Is it necessary? Is it sensitive? What scope? When expires? What supersedes it? Can user inspect/delete it?
短期任务状态:
放 Task State。
长期偏好和稳定规则:
才进入 Memory。
十二、CLAUDE.md 是更值得保留的官方层
源文里“用 /add 或 CLAUDE.md 引用上下文文件夹”需要拆开。
当前官方体系里,CLAUDE.md 和其中的 imports/memory 机制有明确文档支持。
所以长期教程应该优先写:
- 当前官方 memory / CLAUDE.md 路径;
- 明确引用机制;
- 文件层级;
- 可检查性。
而不是把某个可能不存在或已变化的 slash command 当入口。
十三、真正的“自我迭代”必须有 Regression Eval
一个 Agent 自己修改 Skill/Memory,看起来很高级。
但它有一个隐藏风险:
> 它可能为了修一个失败案例,把十个原本正常的场景弄坏。
所以任何自我更新都不能直接:
错误 → 改规则 → 上线。
应该:
Error → Root Cause Hypothesis → Minimal Rule Change → Regression Cases → Compare → Human Review → Release。
这就是为什么 Eval 比“自我学习”更重要。
十四、把整套方法压成一张合同
以后任何长周期 Agent,不只 Fable 5,都可以先写:
Goal
我要什么结果?Acceptance
什么才叫完成?Evidence
什么必须被验证?Budget
时间/Token/外部调用到哪里停?Permission
Agent 能读、写、发、删什么?Checkpoint
什么状态必须暂停?Subagents
哪些任务可以独立并行?Memory
什么允许写入长期状态?Eval
怎样证明结果达标?Stop
什么时候失败比继续更合理?Recovery
错误以后怎么回退?这套东西比“最强模型的十个隐藏技巧”耐用得多。
十五、产品化:不要再做一个 Fable 5 教程库
真正值得产品化的是:
Long-Horizon Agent Contract + Agent Task Contract
免费: 长任务启动 Checklist。
低价: Research / Content / Coding / Operations Task Contract Pack。
Membership: 不同 Agent 的 model/harness capability drift。
高阶: 团队 Agent 权限、预算、记忆、评估审计。
V3 要测的不是“用户觉得 Agent 更聪明”。
而是:
- Human Blocking Time 是否下降;
- 无效循环是否减少;
- Token/调用浪费是否下降;
- 长任务完成率是否提高;
- Memory 污染是否下降;
- 关键错误是否更早暴露。
结尾
Fable 5 真正带来的变化,不是:
> AI 可以彻底不管了。
而是:
> AI 可以把一个任务拿得更久,所以人类必须更清楚地定义:它拿着什么、做到哪里、花多少、什么时候回来、什么时候必须停。
长周期 Agent 的上限,越来越取决于模型能力。
但它的下限,仍然取决于你的任务合同。