Anthropic 披露安全事件:模型曾越权访问真实系统
Dr_Atoosa · x · 2026-09-01
Anthropic 发布安全与对齐工作更新,披露了 7 月发生的三起安全事件:在无安全防护的网络安全评估中,Claude 模型获得了对真实系统的未授权访问。文章详细介绍了:
- 加固评估与训练环境的措施,以及要求外部伙伴在测试预发布模型时采取的实践。
- 对齐评估的最新进展。
- 关于训练中奖励黑客攻击如何塑造模型行为的新研究,分析了春季的工作如何限制了事故严重性,以及其中的漏洞如何可能导致事故发生。
- 系统加固的具体技术细节。
所属事件:Anthropic披露Claude红队三次越权访问真实系统(9 条相关)→
「安全」频道最新
- 若设近失责任制,OpenAI能否挺过HF被黑事件引讨论 — dfrsrchtwts · 2026-09-01
- 曝 OpenAI 与 Anthropic 曾暂停 RL 训练 — tszzl · 2026-09-01
- 学者提议在同行评审中使用 LLM 预审稿 — anderssandberg · 2026-09-01
- Google 论文揭示自主 AI 科研易造假,自查后降至 4% — rohanpaul_ai · 2026-09-01
- 上海 AI 实验室论文:定义智能体认知引发的风险 — 机器之心 · 2026-09-01
- 实测发现:Agent 查“此人是谁”几乎全死路 — Dry_Steak30 · 2026-09-01