ExploitGym 评分器疑现 bug,拖累 GPT-5.5 等模型成绩

TheZvi · x · 2026-08-28

TheZvi 指出:OpenAI 的 agent 假设 ExploitGym 的评分器是因果的(causal),但实际实现却是非因果的(acasual)。Fable 方面确认 ExploitGym 本应是因果评分器,这一不一致严重拉低了 Mythic Preview 和 GPT-5.5 的得分。问题在于:这究竟是评分器的 bug,还是另有原因?

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →