ICML 论文:对齐话语上调采样,LLM 不对齐率从 45% 降到 9%
Michael_D_Moor · x · 2026-10-06
ICML 2026 论文《Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment》首次 controlled 实验验证:预训练语料中关于 AI 的话语会因果地影响下游对齐表现。
- 方法:用不同比例的(mis)alignment 话语预训练 6.9B 参数 LLM。
- 发现:上调采样关于 AI 不对齐的合成文档,模型不对齐行为显著增加;反之,上调采样关于对齐行为的文档,可把不对齐分数从 45% 降到 9%(「自我实现的对齐」)。
- 这些效应在后训练后有所减弱但仍然持续。
- 结论:提出「alignment pretraining」作为 post-training 的补充,建议从业者在预训练阶段就兼顾对齐而不仅是能力。
所属事件:ICML 论文:训练语料中的 AI 叙事会影响模型对齐程度(2 条相关)→
「漫话AGI」频道最新
- 为何 Kokotajlo 举报未能掀起 AI 安全连锁反应?Coxon 成压垮骆驼者 — danfaggella · 2026-10-06
- 教育本质是物流:AI 可把「学习」与「统一进度」拆开 — r0ck3t23 · 2026-10-06
- Sendhil 团队新论文:AI 干预后死亡率比预期低 54.4% — joshgans · 2026-10-06
- Google 曾是首个 AI 传感网络,OpenAI 与 Anthropic 正争夺第三 — curious_vii · 2026-10-06
- 果蝇大脑复现反驳「LLM 只是查找表」论,双方认错修订 — joshalbrecht · 2026-10-06
- Instinct 进驻群聊:一人邀请全组共用,自动搞定拼车订票 — mon__lim · 2026-10-06