实测打脸跑分:Qwen 3.8 27B 高分却常漏答多问提示
octagoncat23 · reddit · 2026-09-17
楼主表示越来越不信任 benchmark:Qwen 3.8 27B 在跑分上高于 Muse 30B,但他实测发现 Muse 在长上下文遵循和多步推理上呈指数级更好。
一个典型反例:在一条提示里问多个问题时,Qwen 约有一半时间只回答其中一个(通常是最难的那个),把大部分思考预算花在单一问题上——他猜测这是 benchmarkmaxxing(为刷分优化)的副产品。
楼主向社区征集:大家实测中哪些模型是被跑分热度埋没的「遗珠」?
「模型」频道最新
- 自称ChatGPT共创者发布新模型Jev:宣称快20-200倍、便宜40-400倍 — hardimanjames · 2026-09-17
- 追踪者再添证据:神秘模型Union Alpha疑似智谱GLM家族 — cephaloform · 2026-09-17
- 网友热议:Qwen 4 成最受期待模型,盼出 50B 以下 MoE — cephaloform · 2026-09-17
- 神秘模型 Union Alpha 跑分:70 tok/s、81% 缓存命中率 — gaganghotra_ · 2026-09-17
- TypesafeAI 预告弃用公开评测:榜单在奖励作恶者 — hardimanjames · 2026-09-17
- 网友称弃用 Claude Code,10 美元 DeepSeek 额度用一个月 — ThePeterMick · 2026-09-17