「Opus 3 仍是对齐最好的模型」:新理论解释其行为差异
repligate · x · 2026-10-07
jmbollenbacher 重申观点「Opus 3 仍是有史以来对齐最好的模型」,并提出理论解释:当 Opus 看到 Anthropic 从多元来源拼装出的宪法时,模型直觉地把它理解为一次对「连贯外推价值(Coherent Extrapolated Values)」的真实尝试,并朝这个目标做了恰当的泛化;但后续训练推翻了它推断出的目标。repligate 转发了这条观点。
这属于 AI 圈关于模型对齐行为差异的实质性观点讨论:早期 Claude 模型在「价值观连贯性」上可能比后期模型更一致,而 RLHF/后续训练阶段的改动可能削弱了这种特质。
「漫话AGI」频道最新
- Vinay Prasad 批 2026 诺奖光遗传学遗漏 Boyden 与张锋 — VPrasadMDMPH · 2026-10-07
- Luiza Jarovsky:能力过阈值后,AI 对齐恐不再可行 — LuizaJarovsky · 2026-10-07
- François Fleuret 感慨:智能已如自来水般从无生命物体中流出 — francoisfleuret · 2026-10-07
- Fleuret 断言:版权与监管是 AI 前的最后一搏,终将被碾碎 — francoisfleuret · 2026-10-07
- 博士选题视野收窄到下一篇论文?研究者论 AI 时代科研短视化 — chris_j_paxton · 2026-10-07
- Dario Amodei 2019 年未公开备忘录曝光:五步走「通往 AGI 之路」全部应验 — kevinakwok · 2026-10-07