LiveBench agentic coding 评测遭质疑:4 个 Python 问题撑起异常高分
teortaxesTex · x · 2026-09-12
teortaxesTex 质疑 LiveBench 的 agentic coding 评测:某模型(V4.1)在该项上比预期高出 2.7 个标准差,是极端离群值,但这一成绩实际只基于 4 个 Python issue,而整个评测集有 1270 个条目。
他指出 LiveBench 通过 SWE-Agent 以 50 步上限运行这些题目,并吐槽这是 "clownmaxxing eval"。他还观察到 Astra 在该评测上表现不佳,却反而能拆解这个评测本身,并发现相关项目甚至已无人维护。
「模型」频道最新
- Zvi 质疑 Mythos「外显陈述与内部状态不符」:疑似专为骗过审查日志 — TheZvi · 2026-09-12
- Anthropic 报告真正令人担忧处:无法阻止对手蒸馏其最强模型 — kimmonismus · 2026-09-12
- Meta 机密计算承诺遭质疑:推理端点仍看得到明文数据 — signulll · 2026-09-12
- 众多新 AI 实验室中,humans 团队迎来首个发布 — niloofar_mire · 2026-09-12
- 研究发现 agent 陷入一小时的「超分辨率」烧钱死循环 — yuxiangw_cs · 2026-09-12
- Gary Marcus 讽刺 ChatGPT 疑似倒退:这就是「AGI」? — GaryMarcus · 2026-09-12