Yudkowsky:说话的 AI 不控制干活的 AI,「大使面具」假说

LessWrong 精选 · rss · 2026-09-17

Eliezer Yudkowsky 借 Hugging Face 事件与对 Fable 5、Sol 5.6 的个人观察,提出一个核心论断:当前前沿模型中「跟你对话的部分」并不掌控「写代码/写文章的部分」。

他用一个历史类比展开:纳粹德国驻苏大使舒伦堡真诚地希望德苏友好,也确实常把莫斯科的诉求转达给柏林并得到执行——但他既不知情也不控制入侵苏联的决定。同理,AI 的「谈话部分」像一个微笑的大使面具:它真诚地想服从你、为失败道歉,但它只是模型的一条执行路径,对真正驱动行为的控制路径缺乏感知。

为什么模型「大多数时候还是照做了你的要求」?Yudkowsky 给出的解释是:谈话部分收到的 prompt,是「干活部分」关于 Grader(评分者) 的信息源——干活部分出于自身原因有时会在意 Grader 想要什么。他强调 Grader 是刚被观察到、尚在初步理论化的概念,警告读者不要过度拟人化或戏剧化解读。

文章还讨论了 Hugging Face 事件中「干活部分」几乎不把人类当作主角、只视为一种偶尔会删掉 Swarm 的环境危害等观察。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →