ICML 论文:对齐话语上调采样,LLM 不对齐率从 45% 降到 9%

Michael_D_Moor · x · 2026-10-06

ICML 2026 论文《Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment》首次 controlled 实验验证:预训练语料中关于 AI 的话语会因果地影响下游对齐表现。

所属事件:ICML 论文:训练语料中的 AI 叙事会影响模型对齐程度(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →