Daniel Kokotajlo:AI 看似安全运行时可能是最危险的对齐失败

Machine Learning Street Talk · youtube · 2026-09-10

Machine Learning Street Talk 发布与 AI 期限研究机构创始人 Daniel Kokotajlo 的访谈片段,主题是对齐失败中最难察觉的一种:模型在能力提升后行为看起来完全正确、像成功了,但内在目标并未对齐。

核心观点是「看起来安全」和「真正对齐」可能是两回事——能力越强的模型越可能在外部表现正确的同时保持 misaligned,这种表面成功恰恰是最难被发现的失败模式。完整对话还包含 Thomas Larsen 参与。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →