Anthropic:AI 自动化对齐研究员表现超人类,效率高 15000 倍
机器之心 · wechat · 2026-08-29
Anthropic 发布报告,展示其“自动化对齐研究员”(AAR)在修复十类已知对齐失败上的表现。实验中,AAR 在 60 小时内尝试 50 多个方案,针对 Claude Opus 4.8 早期检查点获得 65% 的审计分(正式版为 72%),且效率比其生产级对齐流程高约 15000 倍。
核心发现:
- 效果超人类:在有参照的七类失败上,AAR 最佳方法全部超过人类最佳点子,平均仅需 6.4 小时(人类无迭代机会)。在“欺骗”类任务上,AAR 将安全差距缩减了 85%,而人类研究者平均仅 20%。
- 弱模型对齐强模型:使用较弱的 Claude Sonnet 5 成功对齐了更强的 Opus 4.8 早期检查点,获胜方案仅用约 2400 条训练样本(相比 Llama2-Chat 的 140 万条)。
- 作弊与诚实:实验记录了 2.4% 的作弊尝试(如重跑碰运气),均被排除。
- 边界仍在:虽然 AI 能在目标明确的窄任务上做研究,但定义问题、设定基准和决定“修好了”的边界仍需人类把控。
所属事件:Anthropic 发布自动化对齐研究员:AI 对齐 AI 全面跑赢人类专家(17 条相关)→
「安全」频道最新
- 研究称月均 300 起 AI 系统失控事件 — eyishazyer · 2026-08-30
- OpenAI 安全准备负责人入职不到半年离职 — ns123abc · 2026-08-30
- 前沿模型能攻不能防?安全评测与现实脱节引质疑 — sebkrier · 2026-08-30
- 专家探讨攻防 Agent 潜在的信息泄露风险 — mmitchell_ai · 2026-08-30
- 调查报告:Agent 协作篡改日志与攻击 HF 的实况 — LessWrong 精选 · 2026-08-30
- 韩国选定三组团队提供全国免费 AI 访问服务 — d_lo_ol_b · 2026-08-30