Meta 开源 RankEvolve:双 agent 互审把自动实验准确率从 45.8% 提到 62.5%
dair_ai · x · 2026-10-04
Meta 发布论文 RankEvolve,解决让 coding agent 自动跑 ML 实验时的可靠性问题:一个静默 bug(如评测数据泄漏、梯度断连)就可能作废数小时训练及其后续所有迭代。
核心做法:
- 用编译协议强制每个研究阶段与关卡(gate)按规范执行
- 将 Claude Code 与 Codex 作为独立节点互相审查、修复彼此的改动
结果:
- 相同预算下,两个产品组合将执行准确率从最佳单品的 45.8% 提升至 62.5%
- 在开源 HSTU 推荐模型上迭代 12 轮,MovieLens-20M 的 NDCG@10 较已发表结果再提升 4.48%
「编程与Agent」频道最新
- Vercel 年化营收达 6 亿美元,一半新业务来自编程 Agent — evilrabbit_ · 2026-10-04
- Hallmark:让 Claude Code 生成界面告别 AI 味的 29.5k 星技能 — tom_doerr · 2026-10-04
- 别再靠微调修检索问题:Oracle 工程师讲知识该放哪 — AI Engineer · 2026-10-04
- 用 MCP 存决策图谱:隔周回到 Agent 项目也能追溯每条结论 — Mountain-Raise-4556 · 2026-10-04
- 极客用 Lean 语言完整重写《毁灭战士》,还顺手加了形式化证明 — akbirthko · 2026-10-04
- 自研极简编码 agent Jin:只用 3 种 API 标准,用 prompt 替代 MCP — aldapsiger · 2026-10-04