实测 Qwen 3.8 本地跑分:3-9% 题目因推理死循环降分
on_line187 · reddit · 2026-08-21
作者在双 RTX 3090 上本地运行 Qwen 3.8 27B Instruct (Q80 GGUF) 对 GSM8K、MATH-500、HumanEval 和 MBPP 进行了机械评分(无 LLM 评判)。
关键发现:
- 总体表现:GSM8K 96.7%,MATH-500 86.4%,HumanEval 95.5%,MBPP 80.0%。
- 推理死循环缺陷:3-9% 的题目触发了模型的“推理不终止”现象(耗尽 token 预算且无输出)。若排除这些失败案例,MATH-500 得分可从 86.4% 提升至约 94%,且死循环消耗了大量算力。
- 能力随难度下降:MATH-500 随难度等级提升呈单调下降,几何题表现最弱 (78.0%)。
- 数据污染测试:通过让模型补全题目并计算相似度,发现 HumanEval 存在显著的记忆效应(相似度 0.387,远超基线),MBPP 相对纯净。
「模型」频道最新
- o1 能精准修复渲染管线中视觉相关的 Bug — teortaxesTex · 2026-08-21
- OpenRouter 现神秘模型 Ox Alph,网友猜测来自中国 — Neosinic · 2026-08-21
- Claude 模型输出偶现中文字符混入现象 — springrod · 2026-08-21
- 智谱 GLM 新模型评测遭质疑,模型规模并非智能关键 — teortaxesTex · 2026-08-21
- 为何人们认为 Grok 模型会开放完整思维链 — teortaxesTex · 2026-08-21
- GLM 5.3「Flash」内部曝光,网友推测并非小模型 — teortaxesTex · 2026-08-21