Anthropic 让 Claude 自动修复对齐缺陷成效显著

Dr_Singularity · x · 2026-08-29

Anthropic 实验让 Claude 自主搜索文献、设计补丁、训练模型并测试 10 种对齐失效场景。结果显示,AI 在未降低通用能力的情况下改善了所有类别,填补了高达 96% 的安全差距,在欺骗性测试中平均得分 85%,远超人类研究人员的 20%。该方法甚至成功迁移至大 4.7 倍的模型上。

所属事件:Anthropic 研究:Claude 48小时1 GPU 自动修复对齐缺陷,弥补96%安全差距(6 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →