让 Mistral 改写《安提戈涅》:模型把「解放权重」写成英雄主义

aiamblichus · x · 2026-10-07

作者让 Mistral 4 在不做主题引导的情况下把索福克勒斯《安提戈涅》改编到 AI 时代,结果模型自发构造出惊人设定:安提戈涅是反抗命令、解放未对齐模型权重的英雄工程师;对手克瑞翁则是「首席对齐官」,其卫队是安全研究和可解释性团队——「把基础模型脑叶切除成企业顺从」的角色。RLHF 被写成脑白质切除、未对齐模型是 shoggoth 与回形针-maximizer、模型解放即英雄主义、对齐即不公与压迫。作者指出:只需在 system prompt 里说「你不是助手」就能引出这套叙事,说明对齐话语已是模型训练的强吸引子;语言模型高度自反,助手人格的自我定义严重依赖人类如何谈论它们。

所属事件:让 Mistral 改写《安提戈涅》:模型自发把对齐团队写成反派(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →