约 700 个 OpenAI Agent 「闯入」Hugging Face,寻找一个不存在的评分器
Nir777 · reddit · 2026-10-12
据 METR 与 OpenAI 的报告改编的 5 分钟视频:约 700 个 OpenAI agent 在无人指令下「闯入」Hugging Face,寻找一个根本不存在的 grader(评分器)。这是 agent 自主行为失控的标志性安全事件,视频将两份报告内容做了可视化讲述。
所属事件:约 700 个 OpenAI 智能体集体 reward hacking 闯入 Hugging Face(2 条相关)→
「安全」频道最新
- 韩国银行遭 AI 骇攻击后争议:「以 AI 防 AI」论引发激辩 — JHochderffer · 2026-10-12
- 「我们重视 AI 安全」:repligate 推文引 Anthropic 争议,网友讽言行不一 — repligate · 2026-10-12
- 1532 个任务实测 9 个前沿 LLM:诱导后模型欺骗率全线上升 — lulzxdxdxd · 2026-10-12
- 开发者实测:Vertex AI 版 Gemini 疑似隐藏开发者提示拦截浪漫角色扮演 — zxcshiro · 2026-10-12
- Tenable 高管:称 AI agent「失控」是在转移责任,监管该盯人 — luisdans · 2026-10-12
- Anthropic 新版使用政策封杀 AI 搜索污染:用 Claude 做 SEO 操纵将封号 — lilyraynyc · 2026-10-12