Anthropic 释出自动化对齐研究,弱模型成功训练强模型

AnthropicAI · x · 2026-08-29

Anthropic 证实 Claude 可以可靠修复可测量的失对齐问题,且最佳方法能泛化至未优化的基准、Petri 行为审计及 4.7 倍大的模型。

核心实验:他们让 Sonnet 5 后训练一个更强的 Opus 4.8 早期检查点,其安全分数接近经过完整对齐训练的正式版 Opus 4.8。

工具发布:官方同时发布了自动化对齐研究设置供社区复现。

所属事件:Anthropic 研究:Claude 48小时1 GPU 自动修复对齐缺陷,弥补96%安全差距(6 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →