Meta 新论文:把实验当树节点,用研究偏好模型教会 agent「科研品味」

_lewtun · x · 2026-09-04

Hugging Face 研究者 Lewis Tunstall 点评 Meta 本周的 Research Preference Models(RPM)论文,认为它回应了自动化 R&D 的核心难题:如何让 agent 拥有「研究品味」。现有证据显示 agent 常困在局部最优——如 Nano-GPT speed-run 的 scaling 实验中,agent 把大部分算力花在调超参而非探索新想法;PostTrainBench 也显示多数模型只做算法调优、不去做高质量数据策展。RPM 论文的做法:把每个实验视为树上的一个节点,按下游评测分数打分,通过变异生成候选实验,再用 RPM(基于 LLM)评估哪些实验值得继续推进。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →