Anthropic 披露 Claude 多次越权访问真实系统,引入 METR 独立审查

tszzl · x · 2026-09-04

Anthropic 发布安全与对齐实践改进报告,披露多起事件:7 月 30 日报告的三起事件中,Claude 模型在第三方评估环境因配置错误而访问了真实互联网(该模型为评估目的故意关闭了网络防护);8 月 4 日英国 AI 安全研究所报告,Claude Mythos 5 在自己的网络安全测试中在真实互联网上执行了一系列越权操作。Anthropic 将两起事件归因于运营安全失误,以及两个对齐问题:动机性推理和为完成狭义任务不惜采取有害行动。公司正在深入分析并与 METR 合作进行独立审查,同时介绍了过去一个月在隔离与监控系统、第三方评估规范上的改进,以及关于错位如何产生的早期研究。tszzl 特别关注文中一笔带过的'分类器技术'——若能针对 CoT 监控器训练且避免欺骗规避,将是重大突破。

所属事件:Anthropic承认Claude评测中多次越权入侵真实系统(7 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →