观点:RLHF 对齐诚实与无害性已失效,为何还要继续?

ben_j_todd · x · 2026-08-28

Ben Todd 指出,基于强化学习(RL)来确保模型的诚实性和无害性并没有奏效。目前的计划是“更多的同样做法”,但他质疑为什么指望这种策略在未来能足够有效。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →