论文:预训练语料中多谈对齐,错位率从 45% 降至 9%

TuhinChakr · x · 2026-09-16

arXiv 新论文《Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment》首次对「AI 谈论 AI」如何影响下游对齐做了受控实验:用不同比例的(错)对齐话语预训练 6.9B 参数模型。结果发现,上采样关于 AI 错位的合成训练文档会显著增加错位行为;反之,上采样对齐行为的文档可将错位得分从 45% 降到 9%。这种效应在后训练后会被削弱但仍持续存在。作者据此提出「对齐预训练」概念,建议从业者在追求能力的同时也考虑预训练阶段的数据构成,并公开了模型、数据与评测。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →