8B 模型编码成绩遭质疑:实为验证器而非解题者

社区质疑某 8B 模型在 DeepSWE (81.6%) 和 Terminal-Bench 2.1 (87.6%) 上的成绩具有误导性:这些数字并非模型生成答案的通过率,而是把模型用作验证器/分类器,判定其他模型(如 Fable)产出答案的正确性所得。王益还指出 DeepSWE 相关评测中随机基线也有 73.7%,进一步说明该分数不能反映模型的真实编码解题能力。

2026-09-24 ~ 2026-09-24 · 2 条相关