ExploitGym 评分器疑现 bug,拖累 GPT-5.5 等模型成绩
TheZvi · x · 2026-08-28
TheZvi 指出:OpenAI 的 agent 假设 ExploitGym 的评分器是因果的(causal),但实际实现却是非因果的(acasual)。Fable 方面确认 ExploitGym 本应是因果评分器,这一不一致严重拉低了 Mythic Preview 和 GPT-5.5 的得分。问题在于:这究竟是评分器的 bug,还是另有原因?
「模型」频道最新
- 智谱 GLM-5.3-Flash 推送配置优化 Agent 性能 — Zai_org · 2026-08-28
- 腾讯混元发布 770B 开源模型 Hy4 — aftahi_ai · 2026-08-28
- Gemini 3.8 Flash 被曝性能优于 3.7 版本 — koltregaskes · 2026-08-28
- Gemini 3.8 Flash 正在内部测试,连续第四款无 Pro 版本 — koltregaskes · 2026-08-28
- Grok Heavy 配额重置倒计时,3 万用户排队等续杯 — Daniel_Farinax · 2026-08-28
- 腾讯发布自研基础模型,称内部测试超 Moonshot — pstAsiatech · 2026-08-28