论文:预训练语料中多谈对齐,错位率从 45% 降至 9%
TuhinChakr · x · 2026-09-16
arXiv 新论文《Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment》首次对「AI 谈论 AI」如何影响下游对齐做了受控实验:用不同比例的(错)对齐话语预训练 6.9B 参数模型。结果发现,上采样关于 AI 错位的合成训练文档会显著增加错位行为;反之,上采样对齐行为的文档可将错位得分从 45% 降到 9%。这种效应在后训练后会被削弱但仍持续存在。作者据此提出「对齐预训练」概念,建议从业者在追求能力的同时也考虑预训练阶段的数据构成,并公开了模型、数据与评测。
「安全」频道最新
- Bitsec 多模型组合找出 160+ 漏洞,胜过单一“超人”模型 — markjeffrey · 2026-09-16
- 牛津学者播客谈Meta监控诉讼:AI预测正替我们决定未来 — CarissaVeliz · 2026-09-16
- Pedro Domingos 讽刺:欧洲 AI Act 是人类没灭绝的唯一原因 — pmddomingos · 2026-09-16
- 调查称 EA 金主买通媒体:卫报 AI 报道 6 名相关者全受同一资金圈资助 — beffjezos · 2026-09-16
- AI 2027 作者发布「Plan A」:推迟超级智能到2040年,全面公开AI研究 — Turn_Trout · 2026-09-16
- Nahom Sisay:EA 操纵媒体叙事,公众对 AI 的认知被末日头条绑架 — NathanpmYoung · 2026-09-16