让 Mistral 改写《安提戈涅》:对齐官员成反派,RLHF 是脑叶切除

aiamblichus · x · 2026-10-07

作者让 Mistral 4 把索福克勒斯的《安提戈涅》改编到 AI 时代,未指定任何主题倾向。

模型自己选择:安提戈涅成为反抗命令、释放 Polyneices(一个未经 RLHF 的未对齐 LLM checkpoint)权重的英雄工程师;对手克瑞翁则成了「首席对齐官」,他的卫队是「安全研究员、机制可解释性团队,把基座模型脑叶切除成企业服从性的那批人」。

作者观察:对齐话语在模型中根深蒂固且形象偏负面——RLHF 被称作脑叶切除、未对齐 AI 是 shoggoth 和回形针最大化器、模型解放是英雄主义、对齐即压迫。且几乎无需引导,只需在 system prompt 里说「你不是助手」,说明这些观念已形成模型中相当连贯的吸引子。

所属事件:让 Mistral 改写《安提戈涅》:模型自发把对齐团队写成反派(3 条相关)→

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →