ICML 论文:语料中的负面 AI 叙事会让模型真的更不对齐

Michael_D_Moor · x · 2026-10-06

Michael Moor 分享对一篇 ICML'26 论文(见同帖系列)的思考:预训练语料中的负面 AI 文学(如反乌托邦科幻)会提高模型的 misalignment 分数,即「自我实现的(不对齐)」——文学如何描绘 AI 可能影响未来 AI 行为、为其提供「合理/预期行为」的模板。

他进一步提出一个少有人讨论的推论:自我实现的对齐效应对我们如何对待其他动物(如工厂化养殖中被当作「低等存在」的对象)可能有重大启示——这同样在为「更强大的智能体应如何对待可控制对象」书写负面的自我实现模板。

所属事件:ICML 论文:训练语料中的 AI 叙事会影响模型对齐程度(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →