Prime Agent真正值得看的不是“后台一直跑”,而是它把Agent记忆从聊天记录变成可更新、可回滚的运行状态
AI编码助手最熟悉的失败之一是:新会话开始,又要重新解释项目、目录、已经踩过的坑和刚才做到哪一步。 Prime Agent当前官方定位是面向编码、研究和长任务的开源Agent。它把上下文当成可编程变量、允许递归子Agent调用,并通过Continual Harness保存补充prompt、memory、skill描述和可复用subagent规格。 真正值得提炼的不是“永远不失忆”,而是:Age
Prime Agent真正值得看的不是“后台一直跑”,而是它把Agent记忆从聊天记录变成可更新、可回滚的运行状态
AI编码助手最熟悉的失败之一是:新会话开始,又要重新解释项目、目录、已经踩过的坑和刚才做到哪一步。
Prime Agent当前官方定位是面向编码、研究和长任务的开源Agent。它把上下文当成可编程变量、允许递归子Agent调用,并通过Continual Harness保存补充prompt、memory、skill描述和可复用subagent规格。
真正值得提炼的不是“永远不失忆”,而是:Agent State也需要生命周期管理。
1. 持久化不是越多越好
如果把每一次失败、每句用户反馈、每个中间猜测都永久写入memory,很快会变成一座垃圾堆。
至少应该区分:
- Task State:这一次做到哪;
- Project Fact:项目当前真实状态;
- Reusable Rule:经过验证可复用的规则;
- User Preference:稳定偏好;
- Failure Lesson:失败原因;
- Temporary Hypothesis:尚未验证的猜测。
Temporary Hypothesis不能因为“曾经发生过一次”就升级成永久规则。
2. “自改进”最危险的是错误固化
假设Agent今天误判一个依赖版本,然后把“以后都这样做”写入长期memory。
下一次它不是重新犯错,而是更自信地自动犯错。
因此持久规则的升级应该像代码变更:
Observation → Evidence → Candidate Rule → Scope → Regression Test → Approval → Version → Rollback。
这就是本批要新增的一条硬规则:
Memory Write = Code Change。
既然代码需要review、版本和回滚,长期可执行记忆也应该。
3. 长任务的核心不是“进程永远活着”,而是能恢复
后台任务真正有价值的状态包括:
- 当前阶段;
- 最近成功产物;
- 最后一次有意义的状态变化;
- 当前依赖;
- 当前Blocker;
- 下一步;
- 是否可以安全重试。
这与我们B49已经形成的Agent Progress Contract完全一致:
Artifact Delta + State + Dependency + Blocker。
4. Heartbeat只能证明“有信号”,不能证明“有进展”
心跳显示进程没死,是好事。
但一个Agent也可能连续两个小时每分钟心跳一次,却没有任何有效产物。
因此还需要: last meaningful artifact; last state transition; last external call; retry count; cost/token; blocker。
Alive ≠ Progress。
5. 子Agent也不是越多越强
Prime Agent支持真实child agents,这给并行任务提供了基础。
但旧规则仍然成立:只有当任务可以按照 Deliverable / Interface / Acceptance 拆开时,Delegation才有意义。
否则每增加一个Agent,就增加: 上下文; 合并; 冲突; 成本; review。
最坏情况是五个Agent同时在不同方向“自改进”。
6. 记忆本身还是一份数据资产
长期memory可能逐渐吸收: 客户代码; 内部路径; API返回; 用户偏好; 测试数据; 业务事实; 密钥误写; 个人信息。
因此Memory Lifecycle必须加入: Scope; Sensitive Data Exclusion; Expiry; Supersede; Export; Delete; Audit。
“记忆功能”不是一个聊天便利功能,它属于数据治理。
7. 项目活跃不等于可靠性已被独立证明
当前官方仓库活跃、提交很多、采用MIT,这些都能证明项目真实且在持续开发。
但README中的“self-improving”“long-running autonomous”等仍然首先属于项目能力描述。
本批没有实际部署Prime Agent,因此不能写: “不会丢进度”; “能稳定跑数天”; “比普通Agent可靠多少”。
8. 真正的商业机会:Agent Continuity Audit
企业最实际的痛点不是“Agent记忆少”,而是:
- 换会话重复解释;
- 任务中断没人知道进度;
- 错误规则被长期固化;
- 项目规则何时改变没人知道;
- Memory越来越大却没人清理。
可以做成一套Continuity Audit:
Memory Inventory → State Schema → Rule Promotion → Heartbeat/Progress → Recovery → Rollback → Sensitive Data Policy → Expiry/Delete。
9. V3怎么测
对同一种长任务重复执行,记录: 重连后的恢复时间; 重复工作比例; 错误规则复发率; Human Blocking Time; memory增长; 回滚次数。
如果Memory越来越多,但恢复变慢、错误更难纠正,就需要压缩、废弃或删除。
Stop Rule
任何经验进入长期memory前,如果回答不了: 它来自什么证据? 适用于什么范围? 什么时候失效? 怎么回滚?
就不要永久保存。
真正成熟的Agent记忆,不是记得多,而是知道什么值得留下。