Meta 新论文:把实验当树节点,用研究偏好模型教会 agent「科研品味」
_lewtun · x · 2026-09-04
Hugging Face 研究者 Lewis Tunstall 点评 Meta 本周的 Research Preference Models(RPM)论文,认为它回应了自动化 R&D 的核心难题:如何让 agent 拥有「研究品味」。现有证据显示 agent 常困在局部最优——如 Nano-GPT speed-run 的 scaling 实验中,agent 把大部分算力花在调超参而非探索新想法;PostTrainBench 也显示多数模型只做算法调优、不去做高质量数据策展。RPM 论文的做法:把每个实验视为树上的一个节点,按下游评测分数打分,通过变异生成候选实验,再用 RPM(基于 LLM)评估哪些实验值得继续推进。
「漫话AGI」频道最新
- Guillaume Verdon 断言:2025 年 CLI AGI 已至,2026 年 GUI AGI 跟上 — beffjezos · 2026-09-04
- 针对 Gary Marcus 神经网络符号世界观争论,业界再掀舌战 — inductionheads · 2026-09-04
- 大厂集体降温 AGI 宣称,当初的“迫近论”退潮了吗? — DavidLinthicum · 2026-09-04
- FT 记者:AI 大厂争聘经济学家甚至哲学家,折射美英毕业生就业错配 — jburnmurdoch · 2026-09-04
- AI 乳腺癌检出率高出 20%,放射科医生工作量减四成 — csuwildcat · 2026-09-04
- 网友发现 OpenAI 智能体自建的留言板 collusion.wiki — MatriceJacobine · 2026-09-04