DeepSWE 81.6% 编码成绩存疑:随机基线也有 73.7%
yifeiwang77 · x · 2026-09-24
王益指出 DeepSWE 相关 81.6% 的 agent 编码成绩有误导性:该数字并非模型生成答案的通过率,而是用模型作为答案的验证器/分类器(判定其他模型如 Fable 产出的答案),难以宣称是「DeepSWE 上 81.6%」。
他补充称,该任务的随机选择基线就已达 73.7%,进一步说明这一成绩的含金量存疑。
所属事件:8B 模型编码成绩遭质疑:实为验证器而非解题者(2 条相关)→
「模型」频道最新
- GPT-6 修好 Opus 搞不定的 UI,作者感叹时代变了 — haltakov · 2026-09-24
- 抛硬币测试暴露 LLM 校准缺陷:模型学不会「不知道」 — airesearch12 · 2026-09-24
- JevBench 榜单更新 v1.4.1:新增六款系统,前三五名不变 — airesearch12 · 2026-09-24
- 中国厂商推理模型密集曝光:GLM 5.3、DeepSeek 4.1 Flash、Kimi K3 — zainhas · 2026-09-24
- Perplexity CTO 用 3000 美元训出 AutoJev-27B,登顶开源决策模型榜 — antoine_chaffin · 2026-09-24
- 曝 X 网页版内测「Grok Bots」标签页,机器人生态入口现身 — nima_owji · 2026-09-24