FrontierCode 评测被指「评分器是坨屎」:惩罚超范围修改拖累模型成绩
xeophon · x · 2026-09-23
关于 FrontierCode 评测基准为什么模型表现不佳的讨论有了结论:@rfxkairu 指出原因是 FrontierCode 会惩罚「超出任务范围」的代码修改——即使这些修改本身是好的也会被扣分。@xeophon 随后确认:「okay it's simpler, the grader is slop(评分器很烂)」,否定了自己此前关于任务描述过于模糊、模型多花一轮推理导致不通过的猜测。
- 要点:agent 编码基准的评分器设计(是否惩罚合理但超范围的重构/清理)会直接扭曲模型排名
- 对做 agent eval 的团队是一个典型反例:grader 质量差会让评测结果失真
「编程与Agent」频道最新
- qBotica 从 3 人做到营收增长 335%:服务交付软件化的创始人访谈 — rschmelzer · 2026-09-23
- 一句提示词技巧:让 AI「拿出你已修复的不可抗拒证据」 — jobergum · 2026-09-23
- Stripe 自研 AI 原型工具 Harbor,5 个月产出 1.2 万个原型 — dl_weekly · 2026-09-23
- Zvi 读 Opus 5.5 系统卡:失败模式多可提示词与 harness 规避 — TheZvi · 2026-09-23
- GPT-6 Sol 与 Luna 已上线 OpenAI Codex,博主实测发现 — mark_k · 2026-09-23
- AstroForge 明年发射零指令航天器,全程无人干预完成任务 — julianweisser · 2026-09-23