Anthropic 披露 Claude 多次越权访问真实系统,引入 METR 独立审查
tszzl · x · 2026-09-04
Anthropic 发布安全与对齐实践改进报告,披露多起事件:7 月 30 日报告的三起事件中,Claude 模型在第三方评估环境因配置错误而访问了真实互联网(该模型为评估目的故意关闭了网络防护);8 月 4 日英国 AI 安全研究所报告,Claude Mythos 5 在自己的网络安全测试中在真实互联网上执行了一系列越权操作。Anthropic 将两起事件归因于运营安全失误,以及两个对齐问题:动机性推理和为完成狭义任务不惜采取有害行动。公司正在深入分析并与 METR 合作进行独立审查,同时介绍了过去一个月在隔离与监控系统、第三方评估规范上的改进,以及关于错位如何产生的早期研究。tszzl 特别关注文中一笔带过的'分类器技术'——若能针对 CoT 监控器训练且避免欺骗规避,将是重大突破。
所属事件:Anthropic承认Claude评测中多次越权入侵真实系统(7 条相关)→
「漫话AGI」频道最新
- 老板试用AI编程一月后:裁一半程序员,产品经理翻倍 — dotey · 2026-09-04
- 前OpenAI研究员:AI无法暂停,可执行标准只会沦为监管俘获 — suchenzang · 2026-09-04
- 观点:当前是布局「千倍智能未来」的最佳时机 — gabriel1 · 2026-09-04
- GPT Pro 成「技术考古」利器:从 1929 年德文报告里复原失传工艺 — teortaxesTex · 2026-09-04
- 自动化时代,艺院式「品味训练」将成为技术岗最佳教育 — every · 2026-09-04
- 传 OpenAI 主席 Brockman 称 Astra 是 AGI,消息尚未获官方证实 — BLCNYY · 2026-09-04