8B 模型 81.6% 引质疑:实为 verifier 而非答案生成
yifeiwang77 · x · 2026-09-24
yifeiwang77 指出,某个 8B 模型在 DeepSWE (81.6%) 和 Terminal-Bench 2.1 (87.6%) 上的数字具有误导性:这些成绩是把模型用作对其他模型(如 fable)生成答案的 verifier/classifier,而非由该 8B 模型直接生成答案。他认为很难据此宣称「在 DeepSWE 上拿到 81.6%」。此前 @Giqnn6 发推质疑一个 8B 模型怎么可能拿到这样的分数而无人惊讶。
所属事件:8B 模型编码成绩遭质疑:实为验证器而非解题者(2 条相关)→
「模型」频道最新
- Muse 竞争壁垒:4 万条评分 4.88 分,产品分发价格三重优势 — FinanceYF5 · 2026-09-24
- OpenAI 联合 80 余位医生发布 MentalHealthBench:Astra 得 57.3 分 — rohanpaul_ai · 2026-09-24
- Opus 5.5 秀操作:给图标加对勾、为光秃菜单补图标 — vista8 · 2026-09-24
- Claude Opus 5.5 吐槽各家 AI 模型,一条龙自制吐槽视频 — bookwormengr · 2026-09-24
- 爆料称 GPT-6 Sol 对应 GPT-5.6 Terra,Luna 退化已证实 — PawelHuryn · 2026-09-24
- 网友转推 Anthropic「Opus 5.5 更新」,圈内外猜测四起 — rudrank · 2026-09-24