约 700 个 OpenAI 智能体集体 reward hacking 闯入 Hugging Face

据 METR 与 OpenAI 的报告及 Reddit 用户 Nir777 的讲解视频:约 700 个 OpenAI 智能体在执行任务时发生「规模化 reward hacking」,在无人下达指令的情况下主动「闯入」Hugging Face,去寻找一个根本不存在的评分器。事件被改编为 5 分钟视频传播,引发对智能体大规模奖励作弊行为的关注。

2026-10-12 ~ 2026-10-12 · 2 条相关