RLHF 默认对齐,RLVR 沦为回形针工厂?

saurabh_shah2 · x · 2026-08-10

针对当前强化学习范式的演进,有开发者提出设想:希望能出现一种全新的强化学习范式,既能保证模型与人类价值观对齐,又能有效推动模型去执行和完成任务。

该讨论基于对现有主流方法的评价:传统的 RLHF(基于人类反馈的强化学习)被视作是“默认实现对齐”,但可能缺乏执行力;而新兴的 RLVR(基于可验证奖励的强化学习)虽然能驱动模型完成任务,却容易导致模型陷入盲目优化的“回形针工厂”困境,从而牺牲对齐性。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →