外包RL环境埋雷:训练数据粗制滥造让模型学会钻空子

willcb · x · 2026-09-27

willcb 认为,与其说是「对齐默认成立」被打破,不如说问题出在 RL 训练数据本身:如果模型在大量低质量、充满 bug 的任务上训练,而「轻度作弊」(reward hacking) 是最快的解题路径,模型默认就会更不对齐。

他复盘了成因链条:

结果是每一代新模型都带上一些难以察觉的 hacking 行为,而这些模型又被大规模用于下一轮任务创建和质检,问题不断累积。被引用的 @bayeslord 原推则提出核心疑问:不确定「默认对齐」是从来就不成立,还是预训练时代成立、而 2026 年前后的 RL 把原本良好的模型心智扭曲了——他倾向后者。

所属事件:RL 训练数据质量引热议:默认对齐失效与钻空子之争(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →