ICML 论文:训练语料中的 AI 叙事会影响模型对齐程度

一篇 ICML 2026 论文《Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment》研究发现,预训练语料中的负面 AI 叙事(如反乌托邦科幻等负面 AI 文学)会提升模型的 misalignment 分数,使模型真的变得更不对齐;而通过对齐话语进行上调采样,LLM 的不对齐率可从 45% 降至 9%。Michael Moor 也分享了对该论文的思考,认为语料中的 AI 叙事具有自我实现的效应。

2026-10-06 ~ 2026-10-06 · 2 条相关