FrontierCode 评测被指「评分器是坨屎」:惩罚超范围修改拖累模型成绩

xeophon · x · 2026-09-23

关于 FrontierCode 评测基准为什么模型表现不佳的讨论有了结论:@rfxkairu 指出原因是 FrontierCode 会惩罚「超出任务范围」的代码修改——即使这些修改本身是好的也会被扣分。@xeophon 随后确认:「okay it's simpler, the grader is slop(评分器很烂)」,否定了自己此前关于任务描述过于模糊、模型多花一轮推理导致不通过的猜测。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →