网友猜 Claude 乱语减少因 RL 限制了 KL 散度

burny_tech · x · 2026-10-11

burnytech 提出一个关于 Claude 训练的推测:Opus 5.5 相比前代 Claude 较少出现「说不可理解语言」的现象,可能是因为在 RL 训练中收紧了 KL 散度上限(capped KL divergence)。KL 散度约束会限制策略偏离初始模型的幅度,收紧它有望抑制输出退化成不可读语言的倾向。这只是未经证实的个人猜测,但切中了 RLHF 训练中语言退化与 KL 约束关系这一技术话题。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →