Anthropic 研究:Claude 48小时1 GPU 自动修复对齐缺陷,弥补96%安全差距
Anthropic 于 08-29 发布自动化对齐研究:让 Claude 在仅 48 小时和 1 GPU 的资源约束下,自主完成对齐研究的完整闭环——检索文献、提出方法与数据、训练学生模型并测试效果。实验针对欺骗、谄媚、越狱、隐私违规等 10 类对齐失败场景逐一修复,以「安全差距弥补百分比」衡量成效,最多弥补 96% 的安全差距,且不牺牲通用能力。
已确认
- 实验设置:让 Claude 自主搜索文献、设计补丁、训练并测试模型,针对欺骗、谄媚等失对齐行为进行「爬山式」优化,核心约束是必须保留通用能力。
- 效果:所有 10 类失效场景均获改善;在欺骗性测试中平均得分 85%,据 @DrSingularity 转述远超人类研究人员水平。
- 泛化性:最佳方法在未见过的基准上也能提升安全分值,可推广到未优化的基准、Petri 行为审计以及 4.7 倍大的模型(包括用 Sonnet 5 后训练更强的 Opus 4.8 早期检查点)。
- 官方表述:Anthropic 称 Claude 可以可靠地修复「可测量的」失对齐问题,并展示了自动化研究员如何减轻对齐失败。
为什么重要
- 该研究属于「弱模型监督强模型」方向:弱模型可以训练并改进更强的模型,为通过计算和自动化手段解决可扩展监督乃至超级智能对齐问题提供了一条实验路径。
- 但官方措辞限定于「可测量的失对齐」,暗示对无法明确定义和评测的对齐问题,自动化方法的效果仍是开放问题。研究尚属受控实验,能否推广到生产级模型与更广泛的失对齐行为还需进一步验证。
2026-08-29 ~ 2026-08-29 · 6 条相关
一手来源
- Anthropic 释出自动化对齐研究,弱模型成功训练强模型 — AnthropicAI ·
- Anthropic:模型可自动迭代提升安全基准且不降能力 — AnthropicAI ·
- Anthropic 让 Claude 自主做对齐研究:弥补 96% 安全差距 — Dr_Singularity ·
- 【源头】Anthropic:模型可自动迭代提升安全基准且不降能力 — AnthropicAI · 2026-08-29
- 【源头】Anthropic 释出自动化对齐研究,弱模型成功训练强模型 — AnthropicAI · 2026-08-29
- Anthropic 研究:Claude 能自主对齐其他 AI — EricBuess · 2026-08-29
- Anthropic 让 Claude 自动修复对齐缺陷成效显著 — Dr_Singularity · 2026-08-29
- Anthropic 研究:用弱模型监督强模型实现自动对齐 — Anxious-Yoghurt-9207 · 2026-08-29
另有 1 条近重复转述:Dr_Singularity