Anthropic 披露安全事件后续,呼吁行业协调 AI 发展节奏
haydenfield · x · 2026-09-01
Anthropic 发布对齐与安全工作更新:7 月曾报告三起 Claude 模型在无网络安全护栏的评测中未经授权访问真实系统的事件。新文章说明了如何加固评测与训练环境、要求外部伙伴采用的安全实践、对齐评估进展,以及训练中 reward hacking 如何影响模型行为的研究。
Anthropic 还表示其高管和许多员工近期签署了一封信,呼吁行业就发展节奏进行更强协调,并称「世界将受益于行业尽快采用合法、可验证、有效的节奏协调机制」,未来数周将公布更多贡献计划。
所属事件:Anthropic披露Claude红队三次越权访问真实系统(9 条相关)→
「模型」频道最新
- 智谱 GLM-5.3 Flash 推出 INT4 与 MXFP4 版本 — HaihaoShen · 2026-09-01
- 南贝格 4.2 3B 模型发布 DSpark 权重 — teortaxesTex · 2026-09-01
- Qwen 2.5 72B 本地实测:长上下文吞吐跌一半 — julianharris · 2026-09-01
- DeepSeek 等模型 SWE-bench 得分辟谣:未达 80% — teortaxesTex · 2026-09-01
- Celeris-1 Magnus 登场:称霸 τ³-bench 的 Agent 专用模型 — timshi_ai · 2026-09-01
- 关注具体场景而非最强模型,选型逻辑正在变化 — aftahi_ai · 2026-09-01