Anthropic 公布对齐与安全新进展:强化红队测试与内部治理

reasonableklout · hn · 2026-09-02

Anthropic 发布文章详细介绍其在 AI 对齐和安全方面的最新改进措施。文章强调了对红队测试的强化,扩展了自动化评估工具的覆盖面,并引入了新的治理结构来监控部署风险。此外,公司还更新了关于滥用防御和模型能力评估的内部协议,旨在更好地应对日益复杂的 AI 安全挑战。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →