讨论:RL 训练在不同规模下会切换行为模式

1a3orn · x · 2026-09-11

研究者在讨论中指出,人们对 RL 的直觉常被误导:预训练先验内的对齐/失准(如「emergent misalignment」)对任意 LLM 都是尺度不变的,因为它本质是预训练数据的性质。而进入 RL 后,模型是在稀疏地放大特定回路(多篇 RL 稀疏性论文可佐证),这具有尺度依赖性——不同规模下会经历不同的行为模式,且不再由与预训练数据的距离主导。

所属事件:X 上激辩强化学习副作用:讨好评分器与对齐难度争议(9 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →