Codex正在从“一个会话写代码”变成多环境、多线程的工程控制面,但最重要的不是多Agent数量,而是隔离、权限、合并和人类注意力预算
AH-0596是一篇极长、极细的Codex编排文章。 原作者把Codex描述成: 跨项目; 跨Git worktree; 跨SSH主机; 多Task; Task内Subagent; App Server可编程控制; 支持Steer/Interrupt; Heartbeat/Cron; Hooks; 审批与沙箱。 这种文章最危险的地方不是信息少。 是产品迭代速度太快。 截至2026-08-15,Op
Codex正在从“一个会话写代码”变成多环境、多线程的工程控制面,但最重要的不是多Agent数量,而是隔离、权限、合并和人类注意力预算
AH-0596是一篇极长、极细的Codex编排文章。
原作者把Codex描述成:
跨项目; 跨Git worktree; 跨SSH主机; 多Task; Task内Subagent; App Server可编程控制; 支持Steer/Interrupt; Heartbeat/Cron; Hooks; 审批与沙箱。
这种文章最危险的地方不是信息少。
是产品迭代速度太快。
截至2026-08-15,OpenAI当前官方已经明确确认几个大方向:
Codex是面向多Agent工作流的command center; App支持built-in worktrees和cloud environments; Remote SSH已GA; Hooks已GA; App Server是双向JSON-RPC控制面; 本地、IDE、App、Web共享Codex harness,但产品Surface并不完全相同。
所以原文“Codex正在变成工程控制面”的主判断成立。
但每一个具体对象名、可用入口、计划限制和命令都属于Capability Drift,需要按当前版本再核。
1. 多Agent的第一原则不是并行,而是隔离
两个Agent同时改同一个checkout:
会看到彼此未完成的变化; 测试结果互相污染; Git diff混在一起; 失败难归因。
Worktree真正价值是:
Parallelism through Isolation。
一个任务一份独立文件树; 独立diff; 独立测试; 独立Review。
并行不是把人复制十份。
是把冲突域拆开。
2. Worktree也不是免费隔离
它共享Git历史。
还可能共享: 数据库; 端口; 缓存; Docker资源; 第三方服务; 测试账号; Secrets。
所以环境隔离Contract至少有:
Filesystem; Branch; Ports; Database; External Account; Secrets; Artifacts。
File Isolation ≠ System Isolation。
3. Remote SSH把能力带进真实基础设施,也放大权限风险
OpenAI当前官方已确认Remote SSH正式可用。
它的价值很直接:
代码和依赖不用搬; 可以在真正Devbox/内网环境执行; 长任务离开本机也能继续。
但SSH环境往往拥有:
真实凭证; 内网; 数据库; 发布权限; 生产相邻资源。
因此远程Agent必须按:
Host Trust; User Account; Writable Roots; Network; Secret Scope; Command Approval; Audit Log; Revocation。
Remote Convenience ≠ Remote Least Privilege。
4. App Server是“控制面”,不是绕过治理的后门
OpenAI当前官方描述App Server为长期进程和双向JSON-RPC API,管理thread并把事件翻译成客户端可消费通知。
这意味着企业可以做:
自定义UI; 审批; 监控; 日志; 编排; 工具集成。
但“能程序化控制Agent”不能解释为:
可以绕过workspace policy。
真正的Control Plane必须继承:
身份; 权限; 沙箱; 网络政策; 审批; 日志。
5. Task和Subagent最大的区别是责任边界
长时程Task通常有:
独立目标; 独立上下文; 独立产物; 独立生命周期。
Subagent更适合:
窄问题; 局部审查; 探索方案; 并行读取。
如果把每件事都拆成Subagent,协调成本会暴涨。
如果所有东西塞一个Task,上下文又会过载。
所以继续执行:
Split by Deliverable / Interface / Acceptance。
不是按“前端工程师/CTO/测试总监”这种拟人角色随意切。
6. 多Agent最容易制造的是Review Debt
5个Agent同时跑:
每个都产出1000行修改。
真正瓶颈马上从编码变成人类Review。
OpenAI自己的Harness Engineering也明确把human QA capacity描述成约束之一。
所以Agent吞吐不能只看:
Tasks Completed。
必须看:
Accepted Change; Rework; Merge Conflict; Review Minutes; Defect Escape。
Agent Throughput ≠ Team Throughput。
7. “Supervisor”不能只是再加一个Agent
一个Supervisor如果: 读同样资料; 用同样模型; 继承同样错误; 没有独立测试;
它只是额外一层总结。
真正Review Independence来自:
独立证据; 独立测试; 不同权限; 不同上下文; 冲突裁决。
Second Agent ≠ Independent Review。
8. Steering和Interrupt必须留下原因
长任务最重要的不是“能纠偏”。
而是以后知道:
为什么改方向? 当时看到了什么? 原计划哪里错? 哪些产物因此失效?
否则线程历史只是聊天流水。
应该保存:
Goal Version; Steering Event; Reason; Affected Work; Decision; Rollback/Discard。
9. Automations需要Budget和Failure Policy
定时Agent如果每天自动:
跑测试; 更新依赖; 看Issue; 生成报告;
就要回答:
失败是否通知? 重复失败是否停? 第三方API变化怎么办? 额度不足怎么办? 机器离线怎么办? 产生PR还是直接写? 谁关闭旧任务?
Scheduled ≠ Stable Forever。
10. Hooks最适合做治理,不适合假装万能安全
OpenAI当前官方把Hooks用于: 扫描Prompt中的敏感信息; 运行validator; 记录对话; 创建memory; 按repo定制行为。
这很有用。
但Hook仍然是代码。
它可以: 配置错; 覆盖不全; 自身失败; 被新Surface绕开。
所以Hook也需要:
Version; Test; Fail-open/Fail-closed; Logging; Owner; Rollback。
11. 合并才是多Agent系统真正的“交易结算”
每个Agent都做完,不等于项目完成。
最后必须处理:
依赖冲突; 数据库迁移顺序; 共享类型; 接口变化; 测试; 性能; UX一致; 文档; Release。
因此每个并行拓扑一开始就定义:
Integration Owner; Merge Order; Interface Contract; Acceptance Suite。
No Merge Plan → Fake Parallelism。
12. 最优Agent数量由协调成本决定
可以粗略理解:
Net Progress = Useful Parallel Work − Coordination − Review − Conflict − Context Sync − Failure Recovery。
如果第5个Agent产生的Review Debt大于它带来的独立进展,就不要开第5个。
这就是Agent Complexity Budget。
13. 对alphahole开发方式的直接影响
以后如果Codex用于网站开发:
ChatGPT继续做: 研究; 产品判断; 验收规则; 平台/商业逻辑。
Codex可以按独立deliverable拆:
数据库; 前端页面; 工具实现; 测试; 导入脚本。
但每个任务必须明确:
Input; Allowed Area; Output; Acceptance; Merge Boundary。
不要让“多Agent很强”变成同时乱改整个仓库。
Stop Rule
出现以下情况减少并行:
- Merge conflict增加;
- Review backlog持续增长;
- Agent反复修改同一接口;
- 多个任务共享无法隔离的数据库/账号;
- 产物无法独立验收;
- Supervisor只是重复同一模型判断;
- 人类不知道哪个结果该信;
- Token/计算成本超过净进度。
Codex编排真正成熟的标志,不是侧边栏里同时跑多少Agent,而是每个Agent为什么存在、能碰什么、如何验收、最后怎样安全地汇合成一个系统。