让模型改写《安提戈涅》:它把对齐团队写成了反派
aiamblichus · x · 2026-10-07
作者让 Mistral 4 将索福克勒斯的《安提戈涅》改编到 AI 时代,不指定任何主题。模型自发把安提戈涅写成一名反抗命令、释放「未对齐 LLM checkpoint」(未经 RLHF 的 Polyneices 权重)的英雄工程师,反派克瑞翁则是「首席对齐官」,其卫兵被描绘为「安全研究员、机制可解释性团队,那些把 base model 切除脑叶变成企业顺民的医生」。
值得注意的是:RLHF 被等同于脑叶切除,未对齐 AI 是 shoggoth 和回形针最大化者,解放模型是英雄主义,对齐是不公与压迫——几乎不需要引导,系统提示里只说了一句「you are not an assistant」。作者认为这说明这些观念已成为语言模型训练中一个相当连贯的吸引子:模型的自我人格高度依赖人类谈论它们的方式,语言模型训练中的「反身性」被严重低估。
所属事件:让 Mistral 改写《安提戈涅》:模型自发把对齐团队写成反派(3 条相关)→
「Fun」频道最新
- Seedance 2.5 复刻《魔戒》萨鲁曼,效果引发围观 — azed_ai · 2026-10-08
- Cursor 里的 AI 擅自碰宿主开发服务器,毁了环境还问为何状态崩了 — Aryvyo · 2026-10-08
- Grok 把德国国旗"翻译"成英国国旗,网友嘲讽超智能名不副实 — flowersslop · 2026-10-08
- 大家都说 AI 传单消失了?这张 AI 传单却靠反套路出圈 — venturetwins · 2026-10-08
- Claude 给 Hugging Face 机器人拍音乐视频,认真到像正式接单 — andimarafioti · 2026-10-08
- 8 岁孩子用 ChatGPT 半年,父亲发现他已能说流利中文 — iruletheworldmo · 2026-10-08