Meta 论文:双编码 Agent 互审,正确补丁率从 45.8% 提至 62.5%
rohanpaul_ai · x · 2026-10-06
Meta 新论文发现,让两个不同的编码 Agent 互相审查补丁,比给单个 Agent 更大预算能捕获更多静默 bug。
- 在同等开销下,混合使用 Claude Code 和 Codex 处理同一任务,完全正确补丁率从 45.8% 提升到 62.5%。
- 问题背景:Agent 修改真实训练代码时可能泄漏测试数据、破坏梯度或接错 flag,代码仍能运行,导致 GPU 算力被浪费并产出看似有效实则错误的结果。
- 机制解释:来自同一产品的 Agent 会以相同方式出错,互审无从发现问题;异构 Agent 的错误不相关,审查才有价值。
- 该效应在一个无关的训练代码库上重复验证成立。
论文:"RankEvolve: A Reliable Multi-Agent Auto-Research Harness for Evolving Ranking Models" (arxiv. org/abs/2609.39551)
「编程与Agent」频道最新
- T3 Code 上线应用内可视化,Agent 可在会话中构建动态体验 — 0xkarasy · 2026-10-06
- 用 Codex 写连线通信,做出双人对战 Game Boy 涂弹游戏 — pvncher · 2026-10-06
- 零插件用 GPT-6 Astra 搭出可交互 3D 动物图鉴 — CodeByPoonam · 2026-10-06
- 用户实测:Opus 5.5 在何时请求执行许可上明显变聪明 — stefanjblos · 2026-10-06
- Anaconda 发布 agent swarm 编排与自主红队测试新能力 — anacondainc · 2026-10-06
- 对 agent 说「有哪些选项」,一行提示词换来好工程师思路 — _Stocko_ · 2026-10-06