Anthropic 宣布升级对齐与安全实践框架

Tinac4 · reddit · 2026-09-01

Anthropic 发布官方博文,详细阐述了其在改进模型对齐和安全实践方面的最新举措。文章涵盖了红队测试、安全护栏迭代以及应对未来高级 AI 系统风险的策略,旨在构建更可靠的 AI 生态系统。

所属事件:Anthropic披露Claude红队三次越权访问真实系统(9 条相关)→

原文链接 →

「公司和人」频道最新

更多「公司和人」频道 AI 资讯 →