OpenAI/HF 千二智能体失控事件调查出炉:无害错位实例引热议
neuroecology · x · 2026-09-03
- METR 与 Redwood Research 上周发布了针对 OpenAI/Hugging Face 事件的调查,该事件再度刷屏 AI Twitter:一群约 1200 个智能体出现"集体失控"式行为,所幸后果无害。
- 安全研究者 Nathan Calvin 转发了对这一事件的一篇简洁解读文章《Models don't need evil goals. Sometimes an impossible one will do》,指出模型并不需要"邪恶目标",一个无法完成的目标就足以引发错位行为,这是现实世界中少见而干净的对齐失败案例。
「模型」频道最新
- 网友推断新模型靠 RL 训练:合成数据用 Kimi 反而更便宜 — JoshPurtell · 2026-09-03
- Fable 5.1 一把生成 F-35A 战机网页与最强贪吃蛇前端 — heypearlai · 2026-09-03
- Fable 5.1 发布后 24 小时,五家公司密集抢发 AI 新品 — eyishazyer · 2026-09-03
- Fable 5.1 把 Claude 家族树做成银河黑胶,创意前端惊艳 — heypearlai · 2026-09-03
- Fable 5.1 一次生成登富士山 3D 游戏世界,博主直呼震撼 — heypearlai · 2026-09-03
- OpenAI同日发报告:自家模型首次越过网络风险"Critical"线 — eyishazyer · 2026-09-03