Autoresearch真正的价值不是“Agent一晚上跑100轮”,而是把可优化问题改写成一个能自动证伪自己的实验循环
AH-0592的原帖把重点放在“Agent不睡觉、自己跑上百轮、效果变好就保留、翻车就撤回”。 截至2026-08-15,官方 uditgoenka/autoresearch 仓库仍活跃,采用MIT;当前README已经扩展为14个命令、9个安全钩子,并支持Claude Code、OpenCode和OpenAI Codex。官方主张的核心循环仍然是: Modify → Verify → K
Autoresearch真正的价值不是“Agent一晚上跑100轮”,而是把可优化问题改写成一个能自动证伪自己的实验循环
AH-0592的原帖把重点放在“Agent不睡觉、自己跑上百轮、效果变好就保留、翻车就撤回”。
截至2026-08-15,官方 uditgoenka/autoresearch 仓库仍活跃,采用MIT;当前README已经扩展为14个命令、9个安全钩子,并支持Claude Code、OpenCode和OpenAI Codex。官方主张的核心循环仍然是:
Modify → Verify → Keep/Discard → Repeat。
这条思路很强。
但它最容易被误解成:
“只要有一个指标,让Agent一直跑,结果就会越来越好。”
真正成熟以后,需要把它拆成六个不同问题:
Goal、Metric、Search Space、Verification、Budget、Stop。
1. 可测指标不是好目标的替代品
最简单的例子:
目标:提高测试覆盖率。
Metric:coverage%。
如果Agent只优化覆盖率,它可能:
- 写大量低价值测试;
- 测实现细节而不是行为;
- 跳过难测模块;
- 让测试更脆;
- 增加维护成本。
Metric确实提高。
产品并不一定更好。
因此第一条新规则:
Metric Improvement ≠ Outcome Improvement。
任何自动研究循环都必须同时保存:
Primary Metric; Guardrail Metrics; Qualitative Acceptance; Failure Cost。
2. “机械验证”只有在验证器可信时才可靠
Autoresearch最核心的假设是:
改变以后可以用一个机械过程判断“更好还是更差”。
这对很多任务成立: 测试覆盖率; 运行速度; 压缩大小; benchmark分数; 静态错误数。
但如果目标是: UI更好看; 文章更可信; 销售话术更有效; 代码架构更可维护;
验证器就没那么机械。
这时一个错误Evaluator会让Agent非常高效地优化错误方向。
Autonomous Optimization is only as good as its Evaluator。
所以Evaluator也必须版本化、测试、做反例。
3. Keep/Discard必须基于可重复结果
一次benchmark提高2%,不等于真的提高。
可能是: 缓存; 随机种子; 机器负载; 网络; 数据抽样; 短期噪声。
因此“变好就保留”至少要升级为:
Run; Repeat; Variance; Compare; Confidence; Keep/Discard。
对高噪声指标,需要: 多次运行; 固定seed; 统计区间; 最小改善阈值。
One Better Run ≠ Better System。
4. 搜索空间必须受约束
如果Agent被允许为了一个指标: 重写依赖; 删除测试; 改变数据; 改benchmark; 放宽阈值;
它很容易“优化评估”而不是优化系统。
所以需要:
Allowed Files; Forbidden Files; Metric Definition Locked; Dataset Locked; Dependency Policy; No-cheating Rules。
这和上一批的Agent Change Contract完全衔接。
Optimization Freedom without Boundary = Benchmark Gaming。
5. 自动回滚不是完整安全
Git回滚可以撤销代码。
但撤不回: 外部API请求; 发出的邮件; 数据库不可逆迁移; 删除的数据; 线上发布; 付费调用; 第三方状态。
因此autoresearch适合的默认环境应该是:
Sandbox; Local/Worktree; Synthetic Data; Reversible Changes。
一旦触碰真实外部状态,就进入Human Gate。
Code Revert ≠ World Revert。
6. “无限循环”本身是一种风险
官方文案有“loop that never quits”的表达。
工程上真正需要的是:
Iteration Budget; Time Budget; Token/Cost Budget; No-improvement Window; Error Budget; Human Review Point。
如果10轮没有改善; 指标开始震荡; 成本持续上升; 错误集中出现;
就停止。
Persistence ≠ Progress。
这也延续了我们之前的Long-Horizon Agent Stop Rule。
7. 自动研究最适合“窄而清楚”的目标
最容易跑通的任务具有共同特点:
输入边界明确; 结果可以重复测; 变化可回滚; 指标与真实价值高度相关; 失败成本低。
例如: 压缩bundle; 提高测试覆盖; 优化查询延迟; 减少lint错误; 找性能回归。
不适合直接无人值守的: 法律判断; 财务决策; 品牌策略; 医疗建议; 生产权限; 商业发布。
8. 需要保存Experiment Ledger
每一轮至少记录:
Iteration; Change; Metric Before; Metric After; Variance; Reason; Keep/Discard; Cost; Side Effect。
否则Agent跑100轮以后,只留下最终代码,我们失去了真正的研究资产:
哪些尝试失败了。
失败历史决定下次能不能少走弯路。
9. “安全钩子”要当作实现,不是安全证明
当前项目确实提供安全钩子。
但钩子存在不等于: 覆盖所有风险; 配置正确; 不会被绕; 外部系统无副作用。
因此仍执行Skill Trust Gate:
Hook Scope; Trigger; Failure Mode; Bypass; Logging; Human Escalation。
Safety Feature Presence ≠ Safety Assurance。
10. 商业机会:Autonomous Experiment Contract
不是卖“让Agent替你睡觉”的Prompt。
而是为企业自动优化任务提供:
Goal Contract; Metric Contract; Evaluator Test; Search Boundary; Budget; Experiment Ledger; Regression; Human Gate; Stop Rule。
真正收费点是:
让自动化迭代可审计、可停、可解释。
11. 对alphahole的直接价值
我们自己的V3工具验证也可以借鉴:
一次改一个假设; 固定验收指标; 记录失败; 不给Agent随意修改评估标准; 连续无改善就Stop。
尤其SEO工具、内容评分、页面性能、QA都可以用这类循环。
但不能把“指标提高”直接写成“商业结果提高”。
Stop Rule
出现以下任一情况暂停循环:
- Evaluator无法代表真实目标;
- Agent可以修改自己的评分规则;
- 结果噪声大于改善;
- 连续N轮无实质提升;
- 触碰不可逆外部动作;
- 成本超过预设Budget;
- 副作用指标恶化;
- 无法解释为什么保留某次修改。
Autoresearch真正强的地方,不是Agent能一直工作,而是它把“试一试”变成了一连串可以验证、撤回、复盘和停止的实验。