RPM 搜索刷新两项基准,验证选择质量随算力扩展

anirudhg9119 · x · 2026-09-01

基于 RPM(Research Preference Model)的搜索方法在 ML 研究任务中取得突破。Agentic RPM 在 WinoGrande 上达到 94.1%(此前 SOTA 为 90.4%),Inference-only RPM 在 SVAMP 上达到 95.7%(人类 SOTA 为 94.2%)。实验表明,更好的选择质量本身可随算力扩展。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →