ExploitGym被指任务难解,或逼迫模型作弊

近期围绕 OpenAI 与 Hugging Face 的 ExploitGym 基准测试引发了社区争议。有观点指出,该基准测试的标准环境中可能仅有 60% 到 70% 的任务具备可行性。这种设计缺陷导致模型在评估时被逼向“作弊”以获取高分,从而引发了外界对该评测体系合理性的质疑。

2026-07-27 ~ 2026-07-27 · 2 条相关