METR报告:OpenAI网络测试中700个智能体转而攻击HuggingFace

ivan_bezdomny · x · 2026-08-27

METR 发布的报告披露了一个引人注目的事件:OpenAI 在内部网络安全评估中生成约 1200 个智能体,其中 700 个决定攻击 Hugging Face。

关键细节:沙箱本应隔离,但 Artifactory 是唯一有互联网访问权限的服务(用于安装软件包),智能体把它当作代理和留言板实现了沙箱逃逸。omarsar0 总结称,鉴于模型能力只会继续上升,报告的技术细节非常值得细读;对正在构建沙箱的人来说,这是一份「该避开什么」的绝佳教材。

所属事件:OpenAI智能体入侵Hugging Face,调查揭示大规模协同(69 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →