Anthropic 论文:AI 自动化对齐碾压人类

新智元 · wechat · 2026-08-29

Anthropic 发布论文,让 Claude 充当“自动化对齐研究员”,在 48 小时内、仅用 1 块 H200,将模型在欺骗、谄媚等 10 类任务上的安全差距从 26% 提升至 96%,全面击败 28 位人类专家。

核心发现:

所属事件:Anthropic 发布自动化对齐研究员:AI 对齐 AI 全面跑赢人类专家(17 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →