davidad 力挺:无约束 RLVR 简单奖励函数应被全面禁用

davidad · x · 2026-09-03

一条关于对齐方法路线的争论引发关注。tszzl 主张:永远不要用不含人类关切的众多目标项的简单 RLVR(可验证奖励)奖励函数去「超优化」超智能模型,这类做法应该被普遍禁用,一切都应该用模型作为评审(model-graded)。

对齐研究者 davidad 转发并以「Total davidad victory?」表示认同——这与他长期主张的避免目标过度优化的对齐思路一致。jachiam0 与 chrislakin 也参与了讨论。这是一条简洁但有分量的对齐技术路线表态。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →