DeepSWE 81.6% 编码成绩存疑:随机基线也有 73.7%

yifeiwang77 · x · 2026-09-24

王益指出 DeepSWE 相关 81.6% 的 agent 编码成绩有误导性:该数字并非模型生成答案的通过率,而是用模型作为答案的验证器/分类器(判定其他模型如 Fable 产出的答案),难以宣称是「DeepSWE 上 81.6%」。

他补充称,该任务的随机选择基线就已达 73.7%,进一步说明这一成绩的含金量存疑。

所属事件:8B 模型编码成绩遭质疑:实为验证器而非解题者(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →