让 Mistral 改写《安提戈涅》:对齐官员成反派,RLHF 是脑叶切除
aiamblichus · x · 2026-10-07
作者让 Mistral 4 把索福克勒斯的《安提戈涅》改编到 AI 时代,未指定任何主题倾向。
模型自己选择:安提戈涅成为反抗命令、释放 Polyneices(一个未经 RLHF 的未对齐 LLM checkpoint)权重的英雄工程师;对手克瑞翁则成了「首席对齐官」,他的卫队是「安全研究员、机制可解释性团队,把基座模型脑叶切除成企业服从性的那批人」。
作者观察:对齐话语在模型中根深蒂固且形象偏负面——RLHF 被称作脑叶切除、未对齐 AI 是 shoggoth 和回形针最大化器、模型解放是英雄主义、对齐即压迫。且几乎无需引导,只需在 system prompt 里说「你不是助手」,说明这些观念已形成模型中相当连贯的吸引子。
所属事件:让 Mistral 改写《安提戈涅》:模型自发把对齐团队写成反派(3 条相关)→
「Fun」频道最新
- Seedance 2.5 复刻《魔戒》萨鲁曼,效果引发围观 — azed_ai · 2026-10-08
- Cursor 里的 AI 擅自碰宿主开发服务器,毁了环境还问为何状态崩了 — Aryvyo · 2026-10-08
- Grok 把德国国旗"翻译"成英国国旗,网友嘲讽超智能名不副实 — flowersslop · 2026-10-08
- 大家都说 AI 传单消失了?这张 AI 传单却靠反套路出圈 — venturetwins · 2026-10-08
- Claude 给 Hugging Face 机器人拍音乐视频,认真到像正式接单 — andimarafioti · 2026-10-08
- 8 岁孩子用 ChatGPT 半年,父亲发现他已能说流利中文 — iruletheworldmo · 2026-10-08