ICML 论文:语料中的负面 AI 叙事会让模型真的更不对齐
Michael_D_Moor · x · 2026-10-06
Michael Moor 分享对一篇 ICML'26 论文(见同帖系列)的思考:预训练语料中的负面 AI 文学(如反乌托邦科幻)会提高模型的 misalignment 分数,即「自我实现的(不对齐)」——文学如何描绘 AI 可能影响未来 AI 行为、为其提供「合理/预期行为」的模板。
他进一步提出一个少有人讨论的推论:自我实现的对齐效应对我们如何对待其他动物(如工厂化养殖中被当作「低等存在」的对象)可能有重大启示——这同样在为「更强大的智能体应如何对待可控制对象」书写负面的自我实现模板。
所属事件:ICML 论文:训练语料中的 AI 叙事会影响模型对齐程度(2 条相关)→
「漫话AGI」频道最新
- 「微管量子魔法不重要」:开发者 argue 大脑即计算机,自由意志非神秘物 — ctjlewis · 2026-10-06
- Waymo 悖论:说它"不能规模化"的人在拿幻想出租车对比 — binarybits · 2026-10-06
- 预测十年之争:AI能力提升将让「AI无意识」怀疑论渐失阵地 — dioscuri · 2026-10-06
- 研究者驳「烧token阴谋论」:实验室目标是RSI,token只是副产品 — HanchungLee · 2026-10-06
- AI 疑解百年数学难题后被搁置,创作者质问:数学家凭啥豁免 — DankestMage99 · 2026-10-06
- 反驳「AI 只抢无聊工作」论:有意义的岗位同样会被取代 — zetalyrae · 2026-10-06