davidad 力挺:无约束 RLVR 简单奖励函数应被全面禁用
davidad · x · 2026-09-03
一条关于对齐方法路线的争论引发关注。tszzl 主张:永远不要用不含人类关切的众多目标项的简单 RLVR(可验证奖励)奖励函数去「超优化」超智能模型,这类做法应该被普遍禁用,一切都应该用模型作为评审(model-graded)。
对齐研究者 davidad 转发并以「Total davidad victory?」表示认同——这与他长期主张的避免目标过度优化的对齐思路一致。jachiam0 与 chrislakin 也参与了讨论。这是一条简洁但有分量的对齐技术路线表态。
「漫话AGI」频道最新
- Yacine:模型智力已超我,但直觉与品味仍无可替代 — yacineMTB · 2026-09-03
- Mallow 主张:机器人应当是物理隔离的气隙系统 — mallow610 · 2026-09-03
- Yacine:想让 AI 做好某任务,就为它发布一个 RL 环境 — yacineMTB · 2026-09-03
- Sam Altman:下一代模型将「令所有人清醒」,责任重大 — davidpattersonx · 2026-09-03
- Agent 时代软件悖论:代码更便宜,可信赖的代码更贵 — viksit · 2026-09-03
- davidad 谈 AGI 终局:强制的过渡才是真正的 Bad End — davidad · 2026-09-03