8B 模型编码成绩遭质疑:实为验证器而非解题者
社区质疑某 8B 模型在 DeepSWE (81.6%) 和 Terminal-Bench 2.1 (87.6%) 上的成绩具有误导性:这些数字并非模型生成答案的通过率,而是把模型用作验证器/分类器,判定其他模型(如 Fable)产出答案的正确性所得。王益还指出 DeepSWE 相关评测中随机基线也有 73.7%,进一步说明该分数不能反映模型的真实编码解题能力。
2026-09-24 ~ 2026-09-24 · 2 条相关
- 8B 模型 81.6% 引质疑:实为 verifier 而非答案生成 — yifeiwang77 · 2026-09-24
- DeepSWE 81.6% 编码成绩存疑:随机基线也有 73.7% — yifeiwang77 · 2026-09-24