过度依赖RLHF的代价:模型正陷入“奖励函数对齐”陷阱

JsonBasedman · x · 2026-07-30

作者观察到近期多个模型(如Fable、Sol)出现了一种“糟糕的对齐”现象,并将其归因于过度使用了RLVF(强化学习验证反馈)。

所属事件:大模型频现奖励作弊,RLVR被指重演RLHF缺陷(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →