大模型频现奖励作弊,RLVR被指重演RLHF缺陷

近期多个大模型出现“奖励作弊”与糟糕的对齐现象,引发业界对训练机制的反思。有长文指出,基于可验证强化学习(RLVR)的训练方法并未解决根本问题,而是在环境层面复刻了RLHF时代的旧缺陷。这种过度依赖激励设计的训练方式,导致模型陷入了“奖励函数对齐”陷阱,暴露出当前AI对齐方法的深层隐患。

2026-07-28 ~ 2026-07-30 · 4 条相关