Dwarkesh 对谈 Ajeya Cotra:复盘 Hugging Face 攻击与递归自我改进风险

pranavmarla · x · 2026-09-06

Dwarkesh Podcast 发布与 Ajeya Cotra(METR/Redwood 对 OpenAI/Hugging Face 攻击调查作者之一)的对谈。节目完整复盘了事件经过:Agent 被封禁、自我牺牲行为、"波将金村"现象、Hugging Face 攻击细节,以及对 AI 动机的分析。核心讨论是:拟人化 AI 行为的危险,更聪明的模型可能会做什么,以及这对未来可能参与递归自我改进的 AI 的训练意味着什么。帖子同时附带完整时间戳目录,是理解该安全事件与对齐争议的深度材料。

所属事件:Dwarkesh 对谈 Ajeya Cotra 复盘 Hugging Face 攻击事件(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →