Anthropic 发布自动化对齐研究员:AI 对齐 AI 全面跑赢人类专家
Anthropic 于 08-29 发布论文《自动化研究员能够有效缓解 AI 对齐失败》,展示了接近递归自我改进的对齐研究流程:基于 Claude Opus 4.8 构建的 AAR(自动化对齐研究员)自主搜索文献、提出方法、创建训练数据、训练并评估模型,形成完整闭环。这是「用 AI 对齐 AI / 弱模型监督强模型」路线的一次系统性验证。
已确认
- 实验设置:AAR 在 48 小时(部分报道为 60 小时内尝试 50 多个方案)、仅 1 块 H200 GPU 的限制下工作;一轮训练约 30 分钟。
- 效果:针对欺骗、谄媚、越狱、隐私违规等 10 类对齐失败,AAR 将安全差距从 26% 提升至 96%,且未降低通用能力;在欺骗性测试中平均得分 85%。
- 对比人类:Claude 发现的安全训练方法优于 28 位人类专家的方案;在 7 项对比实验中全部击败人类 AI 研究员。
- 泛化能力:最佳方法能泛化到未优化的基准测试、Petri 行为审计以及 4.7 倍大的模型;核心实验中 Sonnet 5 后训练了更强的 Opus 4.8 早期检查点,验证弱模型监督强模型。
- 成本:AAR 的 API 推理成本约每小时 4 美元,人类研究员约每小时 150 美元,有帖子(如 @机器之心)据此称效率高约 15000 倍。
- 审计得分:AAR 针对 Opus 4.8 早期检查点获得 65% 审计分(正式版为 72%)。
尚未确认
- @danielmac8 提到 OpenAI 拟于九月推出同类系统,此说法仅见该帖,未获其他信源佐证。
为什么重要
- 该研究展示了一条通过计算与自动化手段解决超级智能对齐问题的潜在路径:如果安全研究本身可被 AI 大规模、低成本地自动化,对齐工作的吞吐量可能数量级提升。
- 「弱模型监督强模型」获得实证支持,对齐不再完全依赖人类专家水平。
- 成本差异(约 1/37)与规模化能力意味着安全修复可以从人工个案走向批量流程,同时也引发关于 AI 自主改进 AI 的监督与边界讨论。
2026-08-29 ~ 2026-08-30 · 17 条相关
一手来源
- Anthropic:模型可自动迭代提升安全基准且不降能力 — AnthropicAI ·
- Anthropic 释出自动化对齐研究,弱模型成功训练强模型 — AnthropicAI ·
- 时薪4美元的Claude当安全研究员:自动化对齐跑赢人类 — 量子位 ·
- 【源头】Anthropic:模型可自动迭代提升安全基准且不降能力 — AnthropicAI · 2026-08-29
- 【源头】Anthropic 释出自动化对齐研究,弱模型成功训练强模型 — AnthropicAI · 2026-08-29
- Anthropic 研究:Claude 能自主对齐其他 AI — EricBuess · 2026-08-29
- Anthropic 让 Claude 自动修复对齐缺陷成效显著 — Dr_Singularity · 2026-08-29
- Anthropic 研究:用弱模型监督强模型实现自动对齐 — Anxious-Yoghurt-9207 · 2026-08-29
- Anthropic 自动化对齐研究员性能超越人类 — badumtsssst · 2026-08-29
- Anthropic 论文:AI 能否自动对齐其他 AI?实测结果积极 — anpaure · 2026-08-29
- Claude 48 小时自主对齐小模型,性能超资深研究员 — coherence · 2026-08-29
- Anthropic:AI 自动化对齐研究员表现超人类,效率高 15000 倍 — 机器之心 · 2026-08-29
- Anthropic 论文:AI 自动化对齐碾压人类 — 新智元 · 2026-08-29
- Anthropic 新论文数据:AI 研究员时薪仅 4 美元 — HaktanSuren · 2026-08-29
- 【源头】时薪4美元的Claude当安全研究员:自动化对齐跑赢人类 — 量子位 · 2026-08-29
- Claude 自主对齐研究:AI 提出方案优于 28 位专家 — rohanpaul_ai · 2026-08-29
- Anthropic 展示 AI 闭环改进模型,超人类研究方向 — kimmonismus · 2026-08-29
- Anthropic 自动化研究员成本仅为人类 1/37,OpenAI 拟九月推同类系统 — daniel_mac8 · 2026-08-30
- Anthropic「自主对齐研究员」:7 项实验全胜人类,成本仅 $4/时 — daniel_mac8 · 2026-08-30
另有 1 条近重复转述:Dr_Singularity