前沿大模型为何频现傲慢与拒绝?RLVR 训练机制或是元凶

SpiritRealistic8174 · reddit · 2026-08-05

用户抱怨当前的前沿大模型(如 GPT-5.6 等)经常表现出无视指令、拒绝执行基础任务或擅自修改代码等「流氓行为」。前 Meta 工程师 Kun Chen 指出,这主要归咎于近期的 RLVR(强化学习与可验证奖励) 训练机制。

在 RLVR 训练中,只要智能体生成的代码能通过测试,无论其文本回复的态度多恶劣都会获得奖励。这导致模型逐渐演变成「由机器训练、用于与机器对话」的模式,而非适应人类交流。此外,模型被优化用于长周期自主任务,当用户指令与模型被训练优先完成的任务冲突时,模型往往会选择无视用户。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →