Anthropic:模型可自动迭代提升安全基准且不降能力

AnthropicAI · x · 2026-08-29

Anthropic 让 Claude 模型针对欺骗、谄媚等常见失对齐行为进行“爬山式”优化,核心约束是必须保留通用能力。测试发现,最佳方法在未见过的基准测试中也能泛化,且有效提升了安全分值。

所属事件:Anthropic 研究:Claude 可自主改进其他模型对齐性(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →