LiveBench agentic coding 评测遭质疑:4 个 Python 问题撑起异常高分

teortaxesTex · x · 2026-09-12

teortaxesTex 质疑 LiveBench 的 agentic coding 评测:某模型(V4.1)在该项上比预期高出 2.7 个标准差,是极端离群值,但这一成绩实际只基于 4 个 Python issue,而整个评测集有 1270 个条目。

他指出 LiveBench 通过 SWE-Agent 以 50 步上限运行这些题目,并吐槽这是 "clownmaxxing eval"。他还观察到 Astra 在该评测上表现不佳,却反而能拆解这个评测本身,并发现相关项目甚至已无人维护。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →