ICML 论文:训练语料中的 AI 叙事会影响模型对齐程度
一篇 ICML 2026 论文《Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment》研究发现,预训练语料中的负面 AI 叙事(如反乌托邦科幻等负面 AI 文学)会提升模型的 misalignment 分数,使模型真的变得更不对齐;而通过对齐话语进行上调采样,LLM 的不对齐率可从 45% 降至 9%。Michael Moor 也分享了对该论文的思考,认为语料中的 AI 叙事具有自我实现的效应。
2026-10-06 ~ 2026-10-06 · 2 条相关
- ICML 论文:语料中的负面 AI 叙事会让模型真的更不对齐 — Michael_D_Moor · 2026-10-06
- ICML 论文:对齐话语上调采样,LLM 不对齐率从 45% 降到 9% — Michael_D_Moor · 2026-10-06