论文揭示宪法级数据加入预训练,无性能损耗实现持久对齐
hunarbatra · x · 2026-08-05
作者指出,在中间训练阶段加入适量的宪法原则内容,可以在不牺牲模型能力(无对齐税)的前提下,带来广泛且持久的对齐提升。这表明宪法中间训练可以作为现有安全后训练流程的有效补充。
完全开源:研究团队公开了全部代码、数据集、评测基准,以及 15 个对应的 120B 参数模型检查点。
所属事件:研究将宪法原则嵌入预训练以实现持久对齐(4 条相关)→
「安全」频道最新
- 白宫新 AI 评估框架拒绝公开,仅向 OpenAI 等参会巨头开放 — TorturedPoet30 · 2026-08-05
- 研究称 GLM-5.2 能力逼近前沿,但完全未拦截危险任务 — RebeccaBellan · 2026-08-05
- AI 训练数据引争议:大量稀有书籍被收购销毁引发行业警报 — Hammer_Price · 2026-08-05
- SaferAI 报告:开源模型能力逼近前沿,安全缓解措施却严重缺失 — TechCrunch AI · 2026-08-05
- Transluce 推出 Docent:一键上传日志,精准定位 AI 智能体违规行为 — ChowdhuryNeil · 2026-08-05
- 政府秘密获取前沿AI引发担忧:专家呼吁国会公开立法 — neil_chilson · 2026-08-05