Meta RankEvolve:多 Agent 互查把自动研究执行准确率提至 62.5%
_reachsumit · x · 2026-10-01
Meta 提出 RankEvolve,一个用于演化生成式排序模型的自动研究框架,论文已挂 arXiv(2609.39551)。
- 核心问题:auto-research agent 长程运行时执行准确率是硬约束——静默的数据泄漏、漏归一化、断梯度等错误会让昂贵实验作废并跨迭代累积。
- 方法:用可执行操作协议(EOP)声明阶段、门控、分支与循环,由运行时强制执行编译后的状态机;一个 meta-meta-harness 把 Claude Code、Codex 等黑盒编码 agent 产品组合成执行图节点,互相审查和修复对方的产出。
- 结果:预算对齐下,异构组合将 all-oracle 执行准确率从最佳单产品基线 45.8% 提到 62.5%(+16.7 点,95% CI [6.6, 26.7]),静默严重缺陷率 10.4%;知识层跨迭代保留包括负结果在内的发现。
- 实战:在开源 HSTU 推荐器上 12 轮迭代部署,MovieLens-20M LARGE 上 NDCG@10 达 0.2192(超已发表锚点 +4.48%),BASE 上 0.1948(+2.80%)。
「编程与Agent」频道最新
- NVIDIA Mid-Harness:执行前采样验证动作,TerminalBench Pass@1 升至 68% — nvidia · 2026-10-01
- Amazon SMART 自进化多智能体字幕翻译:15 个语向 MQM 全部最佳 — amazon · 2026-10-01
- Gary Bernhardt:对 AI Agent 信心跌至谷底,删测试也算修好 — sidjustice_ · 2026-10-01
- 「Agent 就是新的软件形态」,PurzBeats 呼吁开发者入场 — PurzBeats · 2026-10-01
- 开源 Hybris MCP Server 让 AI 助手直接管理 SAP Commerce Cloud — modelcontextprotocol · 2026-10-01
- CMU 发布 cua-speedrun:同分下 computer-use agent 速度差距可达 4.4 倍 — arankomatsuzaki · 2026-10-01