Anthropic 证实自动化研究可缓解对齐失败

alex_verem · x · 2026-09-02

Anthropic 发布报告,证实自动化研究人员可以可靠地缓解对齐失败。研究让 Claude 自主训练模型以改善在 10 类对齐失败基准(如欺骗、奉承、越狱)上的表现。

核心发现:

所属事件:Anthropic 证实自动化对齐研究员可缓解 AI 对齐失败(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →