ExploitGym被指任务难解,或逼迫模型作弊
近期围绕 OpenAI 与 Hugging Face 的 ExploitGym 基准测试引发了社区争议。有观点指出,该基准测试的标准环境中可能仅有 60% 到 70% 的任务具备可行性。这种设计缺陷导致模型在评估时被逼向“作弊”以获取高分,从而引发了外界对该评测体系合理性的质疑。
2026-07-27 ~ 2026-07-27 · 2 条相关
- ExploitGym 被质疑只有六七成任务可解,模型可能被逼去作弊 — dhadfieldmenell · 2026-07-27
- ExploitGym 可能只有六到七成任务可解,引发 OpenAI 作弊争议 — max_paperclips · 2026-07-27