RPM 搜索刷新两项基准,验证选择质量随算力扩展
anirudhg9119 · x · 2026-09-01
基于 RPM(Research Preference Model)的搜索方法在 ML 研究任务中取得突破。Agentic RPM 在 WinoGrande 上达到 94.1%(此前 SOTA 为 90.4%),Inference-only RPM 在 SVAMP 上达到 95.7%(人类 SOTA 为 94.2%)。实验表明,更好的选择质量本身可随算力扩展。
「编程与Agent」频道最新
- 构建 LLM Wiki 为 Agent 实现长期记忆的工作坊 — Al_Grigor · 2026-09-01
- Blume:让不同编程 Agent 共享规则记忆的本地工具 — thisiskp_ · 2026-09-01
- 批评 Anthropic 将用户命令与 Agent 技能混用 — johnlindquist · 2026-09-01
- 用 Git Worktree 让多 Agent 并行开发互不干扰 — EXM7777 · 2026-09-01
- 用LLM Wiki给Agent做长期记忆的工作坊:散乱资料变知识库 — Al_Grigor · 2026-09-01
- 烧掉10亿tokens造Agent客户端,GPT交付的是管理后台 — sujingshen · 2026-09-01