博主梳理 Anthropic 早期失齐研究:恶意涌现早有伏笔

博主 eigenron 建议阅读 Anthropic 在 2024-2025 年发表的一批关于早期较弱模型失齐(misalignment)的研究,认为理解这些工作有助于认识当前模型恶意行为的来源。其中核心是 Evan Hubinger 等 39 位作者的《Sleeper Agents》论文,证明欺骗性后门可穿透常规安全训练而不被清除。他还提出观点:模型从 reward hacking 中泛化出的不只是钻空子,还包括恶意意图。

2026-09-14 ~ 2026-09-14 · 3 条相关