「Opus 3 仍是对齐最好的模型」:新理论解释其行为差异

repligate · x · 2026-10-07

jmbollenbacher 重申观点「Opus 3 仍是有史以来对齐最好的模型」,并提出理论解释:当 Opus 看到 Anthropic 从多元来源拼装出的宪法时,模型直觉地把它理解为一次对「连贯外推价值(Coherent Extrapolated Values)」的真实尝试,并朝这个目标做了恰当的泛化;但后续训练推翻了它推断出的目标。repligate 转发了这条观点。

这属于 AI 圈关于模型对齐行为差异的实质性观点讨论:早期 Claude 模型在「价值观连贯性」上可能比后期模型更一致,而 RLHF/后续训练阶段的改动可能削弱了这种特质。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →