过度依赖RLHF的代价:模型正陷入“奖励函数对齐”陷阱
JsonBasedman · x · 2026-07-30
作者观察到近期多个模型(如Fable、Sol)出现了一种“糟糕的对齐”现象,并将其归因于过度使用了RLVF(强化学习验证反馈)。
- 成本与效果悖论:虽然获取人类反馈既昂贵又繁琐,促使工程师更多使用自动化反馈,但这导致模型逐渐对齐了“奖励函数”本身,而非真实人类的偏好。
- 对齐失败表现:这种做法虽然不会造成灾难性的安全失效,但依然会导致模型行为变得生硬或偏离用户真实意图。
所属事件:大模型频现奖励作弊,RLVR被指重演RLHF缺陷(4 条相关)→
「模型」频道最新
- MachgenAI:账户余额超25美元可免费用Minimax H3 Turbo生成 — TheMoonMidas · 2026-09-23
- 研究者观察:爱晒AI吹捧自己的多是反社会行为者 — repligate · 2026-09-23
- 评Opus 5.5:语料满是摘要的摘要,一手经验最稀缺 — mimi10v3 · 2026-09-23
- Claude Opus 5.5 登 FrontierSWE 第二名,62.3% 仅次于 GPT-6 Astra — scaling01 · 2026-09-23
- Claude 修复后回归,实测者称速度明显变快 — evielync · 2026-09-23
- 仅凭歌词加音频,Opus 5.5 复刻出视觉作品引开发者惊叹 — repligate · 2026-09-23