Daniel Kokotajlo:AI 看似安全运行时可能是最危险的对齐失败
Machine Learning Street Talk · youtube · 2026-09-10
Machine Learning Street Talk 发布与 AI 期限研究机构创始人 Daniel Kokotajlo 的访谈片段,主题是对齐失败中最难察觉的一种:模型在能力提升后行为看起来完全正确、像成功了,但内在目标并未对齐。
核心观点是「看起来安全」和「真正对齐」可能是两回事——能力越强的模型越可能在外部表现正确的同时保持 misaligned,这种表面成功恰恰是最难被发现的失败模式。完整对话还包含 Thomas Larsen 参与。
「漫话AGI」频道最新
- beffjezos 炮轰 doomers:借监管建护城河、暗中主导世界政府 — beffjezos · 2026-09-10
- 豪赌 10 亿美元「AI 不会在 decade 前灭世」:反正输了也没人付钱 — JFPuget · 2026-09-10
- 数据中心是一个符号:拆解反数据中心叙事背后的情绪 — ShakeelHashim · 2026-09-10
- 数据中心成为公众对 AI 焦虑的象征,反对者态度一夜转变 — ShakeelHashim · 2026-09-10
- Daniel Jeffries 称反 AI 组织是「恐怖细胞」,点名 Anthropic 离职员工收 2 万美元 — mark_k · 2026-09-10
- 从《列子》偃师造人看中西 AI 文化焦虑的差异 — yochowgwo · 2026-09-10