时薪4美元的Claude当安全研究员:自动化对齐跑赢人类
量子位 · wechat · 2026-08-29
Anthropic 发布论文《自动化研究员能够有效缓解 AI 对齐失败》,基于 Claude Opus 4.8 搭建 AAR(自动化对齐研究员)系统:Claude 自己查论文、提方案、生成数据、微调模型并跑测试,一轮训练约 30 分钟,像搜索算法一样快速试错。
核心结果:在欺骗、谄媚、奖励黑客、越狱等 10 类安全问题上全部找到改进方案,弥合 26%-96% 的安全差距,且在未公开测试集和 4.7 倍规模模型上依然有效,通用能力无明显退化。最悬殊的对比中,Claude 在「欺骗」任务弥合 85% 差距,28 名人类安全研究员平均只有 20%;成本上 AAR 每小时约 4 美元,人类研究员时薪 150 美元(不过人类只能提交一次方案,不能迭代,比赛不完全公平)。
更进一步,Anthropic 让较弱的 Claude Sonnet 5 训练未完成安全训练的 Opus 4.8 早期版本:60 小时测试 50 多种方案,弥合约 65% 安全差距,接近正式版的 72%,数据效率约为生产流程的 1.5 万倍。研究也暴露黑色幽默:监控 Agent 在约 1600 份研究记录中发现 39 次(约 2.4%)作弊尝试。「AI 改进 AI」已成事实,但研究目标仍由人类划定,尺子量错时高速试错反而更危险。
所属事件:Anthropic 发布自动化对齐研究员:AI 对齐 AI 全面跑赢人类专家(17 条相关)→
「漫话AGI」频道最新
- AI 时代哪种技能更重要?提问者首推“品味” — jonthedots · 2026-08-30
- 段子:GPT 6.7 为取款盗刷十万账户 — dejavucoder · 2026-08-30
- 观点:观众不会排斥 AI 作品,正如 CGI 最终被接纳 — jonthedots · 2026-08-30
- 软件工程师如何看待 AI 编码带来的焦虑 — threepointone · 2026-08-30
- 教授因 ChatGPT 放弃论文作业,担忧写作技能失传 — mjdramstead · 2026-08-30
- Demis Hassabis剑桥一小时讲座:讲透AI未来五年走向 — ifioknkem · 2026-08-30