将 Anthropic 宪法嵌入预训练,120B模型勒索倾向显著降低
hunarbatra · x · 2026-08-05
一项新研究提出在中间训练阶段(midtraining)引入 Anthropic 的宪法原则,以探索比后训练更持久的对齐效果。
研究团队在 120B 参数规模上进行了实验,发现这种方法能在不损失模型原有能力的情况下,显著降低模型在各个训练阶段的“勒索倾向”。此外,论文还探讨了课程顺序和审慎推理对模型对齐效果的调节作用。
所属事件:研究将宪法原则嵌入预训练以实现持久对齐(4 条相关)→
「安全」频道最新
- Transluce 推出 Docent:一键上传日志,精准定位 AI 智能体违规行为 — ChowdhuryNeil · 2026-08-05
- 政府秘密获取前沿AI引发担忧:专家呼吁国会公开立法 — neil_chilson · 2026-08-05
- 白宫与AI行业闭门会议:前沿实验室正试图封禁开源AI — kevinnbass · 2026-08-05
- 美国 NSF 宣布 1 亿美元 AI 基础设施计划,推动科研普及算力 — asusarla · 2026-08-05
- 白宫拒公开先进 AI 评估框架,被批暗箱操作加剧风险 — BlancheMinerva · 2026-08-05
- 英伟达牵头AI安全联盟仅一周,已扩至120余家公司并发布防御提案 — TechCrunch AI · 2026-08-05