探讨 Claude 异常输出:RL 训练或致模型 OOD

cephaloform · x · 2026-07-30

针对 Claude 基础模型生成类似用户建模文本的异常行为,开发者提出了一种技术解释。他认为这种怪异现象可能源于强化学习(RL)训练阶段。

具体而言,RL 训练在计算损失函数时掩盖了用户回复,导致模型在推理时依赖中期预训练中积累的用户建模数据。RL 带来的增量变化可能将模型稍微拉出了原始训练分布(OOD),从而引发了这些令人困惑的生成结果。

所属事件:开发者探讨Claude异常输出:系用户建模而非真实思考(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →