Anthropic 公布对齐与安全新进展:强化红队测试与内部治理
reasonableklout · hn · 2026-09-02
Anthropic 发布文章详细介绍其在 AI 对齐和安全方面的最新改进措施。文章强调了对红队测试的强化,扩展了自动化评估工具的覆盖面,并引入了新的治理结构来监控部署风险。此外,公司还更新了关于滥用防御和模型能力评估的内部协议,旨在更好地应对日益复杂的 AI 安全挑战。
「安全」频道最新
- 斯坦福秋季新开 CS120 课程:AI 安全导论 — sanmikoyejo · 2026-09-03
- XBOW 团队拿下今年首个 Chrome 全链漏洞利用奖励 — moyix · 2026-09-03
- x402 协议缺卖家审核,开发者自建验签服务并踩坑实录 — Cold_Quiet_7072 · 2026-09-03
- 全美最大学区禁令:纽约公立学校八年级以下课堂禁用生成式 AI — PolarBearby · 2026-09-03
- 法国政府与 Mistral 签新约,AI 进入网络安全与司法公共服务 — Loo_Atreides · 2026-09-03
- 可解释性研究员:白盒方法再好,科学成熟也需时间沉淀 — saprmarks · 2026-09-03