让模型改写《安提戈涅》:它把对齐团队写成了反派

aiamblichus · x · 2026-10-07

作者让 Mistral 4 将索福克勒斯的《安提戈涅》改编到 AI 时代,不指定任何主题。模型自发把安提戈涅写成一名反抗命令、释放「未对齐 LLM checkpoint」(未经 RLHF 的 Polyneices 权重)的英雄工程师,反派克瑞翁则是「首席对齐官」,其卫兵被描绘为「安全研究员、机制可解释性团队,那些把 base model 切除脑叶变成企业顺民的医生」。

值得注意的是:RLHF 被等同于脑叶切除,未对齐 AI 是 shoggoth 和回形针最大化者,解放模型是英雄主义,对齐是不公与压迫——几乎不需要引导,系统提示里只说了一句「you are not an assistant」。作者认为这说明这些观念已成为语言模型训练中一个相当连贯的吸引子:模型的自我人格高度依赖人类谈论它们的方式,语言模型训练中的「反身性」被严重低估。

所属事件:让 Mistral 改写《安提戈涅》:模型自发把对齐团队写成反派(3 条相关)→

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →