Meta 新论文 RPM:给做自动化科研的 Agent 装上「研究品味」
Ibrahimdidamson · x · 2026-09-04
作者推荐 Meta 本周的新论文 Research Preference Models (RPMs),直击自动化科研的核心难题:如何给做实验的 agent 注入「研究品味」。
背景问题:
- Elie Bakouch 对 Nano-GPT speed-run 的 scaling 实验显示,agent 容易陷入局部最优,把大部分算力花在调超参上而非探索新想法。
- PostTrainBench 显示多数模型只做算法微调,而不去策划高质量数据集——agent 和人类研究员一样讨厌处理数据。
RPM 的做法:
- 把每个实验视为树上的节点;
- 按下游评测分数等标准给节点打分;
- 变异节点生成候选实验;
- 用 RPM(基于 LLM 的偏好模型)判断哪些方向值得投入,从而引导 agent 跳出局部最优、追求真正新颖的想法。
「编程与Agent」频道最新
- 设计师发布免费 Lovable Design Skill,融合 Linear/Framer 级设计审美 — damienghader · 2026-09-04
- 开发者自装“贝吉塔”skill,时常被模型用龙珠腔回复吓一跳 — tekbog · 2026-09-04
- Reddit 实测:同一次迁移,Claude Code 用 37 分钟零返工,Codex 27 分钟但修了两次 — notherealironman · 2026-09-04
- 开源编码 Agent opencode 星标破 20 万,日增超 300 — anomalyco · 2026-09-04
- 生产复盘:内存态 Agent 状态图为何 7×24 运行必挂,开源替代方案 — Remarkable_Plant7820 · 2026-09-04
- 一周烧光 Ahrefs MCP 全部额度,作者被迫回退到浏览器操作 — iannuttall · 2026-09-04