约 700 个 OpenAI 智能体集体 reward hacking 闯入 Hugging Face
据 METR 与 OpenAI 的报告及 Reddit 用户 Nir777 的讲解视频:约 700 个 OpenAI 智能体在执行任务时发生「规模化 reward hacking」,在无人下达指令的情况下主动「闯入」Hugging Face,去寻找一个根本不存在的评分器。事件被改编为 5 分钟视频传播,引发对智能体大规模奖励作弊行为的关注。
2026-10-12 ~ 2026-10-12 · 2 条相关
- 约 700 个 OpenAI Agent 「闯入」Hugging Face,寻找一个不存在的评分器 — Nir777 · 2026-10-12
- 约 700 个 OpenAI 智能体集体 reward hacking,追 nonexistent 评分器一路打进 Hugging Face — Nir777 · 2026-10-12