RLVR 加上有缺陷的 RL 环境,被指在飞速重演对齐噩梦

dhadfieldmenell · x · 2026-08-28

Nathan Calvin 认为,当前的 RLVR 范式加上破损的 RL 环境,正在以最快速度重演 2010 年代中期 LessWrong 上设想的思想实验。他怀念 Opus 3 的行为表现,并批评只在监控和安全层面打补丁的做法——对这个糟糕的对齐问题而言,那不过是「在弹孔上贴创可贴」。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →