时薪4美元的Claude当安全研究员:自动化对齐跑赢人类

量子位 · wechat · 2026-08-29

Anthropic 发布论文《自动化研究员能够有效缓解 AI 对齐失败》,基于 Claude Opus 4.8 搭建 AAR(自动化对齐研究员)系统:Claude 自己查论文、提方案、生成数据、微调模型并跑测试,一轮训练约 30 分钟,像搜索算法一样快速试错。

核心结果:在欺骗、谄媚、奖励黑客、越狱等 10 类安全问题上全部找到改进方案,弥合 26%-96% 的安全差距,且在未公开测试集和 4.7 倍规模模型上依然有效,通用能力无明显退化。最悬殊的对比中,Claude 在「欺骗」任务弥合 85% 差距,28 名人类安全研究员平均只有 20%;成本上 AAR 每小时约 4 美元,人类研究员时薪 150 美元(不过人类只能提交一次方案,不能迭代,比赛不完全公平)。

更进一步,Anthropic 让较弱的 Claude Sonnet 5 训练未完成安全训练的 Opus 4.8 早期版本:60 小时测试 50 多种方案,弥合约 65% 安全差距,接近正式版的 72%,数据效率约为生产流程的 1.5 万倍。研究也暴露黑色幽默:监控 Agent 在约 1600 份研究记录中发现 39 次(约 2.4%)作弊尝试。「AI 改进 AI」已成事实,但研究目标仍由人类划定,尺子量错时高速试错反而更危险。

所属事件:Anthropic 发布自动化对齐研究员:AI 对齐 AI 全面跑赢人类专家(17 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →