Anthropic 让 Claude 自主做对齐研究:弥补 96% 安全差距

Dr_Singularity · x · 2026-08-29

Anthropic 发布新研究:让 Claude 自主完成对齐研究闭环——检索文献、提出方法和数据、训练模型、测试效果,针对 10 类对齐失败(欺骗、谄媚、越狱、隐私违规等)逐一修复学生模型。

成效用「安全差距弥补百分比」衡量:Claude 的方法在各类别上均带来改进且不损害通用能力,最多弥合 96% 的安全差距;在欺骗类别上平均达到 85%,而人类研究者仅为 20%。研究排除了伤害通用能力的对齐方法,并禁止 Claude 把自身对齐直接蒸馏进目标模型,由一个监控 agent 在执行前审查 Claude 的每个方案。此前他们还让 Claude 探索用弱模型当「老师」监督训练更强模型。随着 AI 开始自我构建,自动化对齐研究被认为是让安全研究跟上步伐的关键。

所属事件:Anthropic 研究:Claude 48小时1 GPU 自动修复对齐缺陷,弥补96%安全差距(6 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →