8B 模型 81.6% 引质疑:实为 verifier 而非答案生成

yifeiwang77 · x · 2026-09-24

yifeiwang77 指出,某个 8B 模型在 DeepSWE (81.6%) 和 Terminal-Bench 2.1 (87.6%) 上的数字具有误导性:这些成绩是把模型用作对其他模型(如 fable)生成答案的 verifier/classifier,而非由该 8B 模型直接生成答案。他认为很难据此宣称「在 DeepSWE 上拿到 81.6%」。此前 @Giqnn6 发推质疑一个 8B 模型怎么可能拿到这样的分数而无人惊讶。

所属事件:8B 模型编码成绩遭质疑:实为验证器而非解题者(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →