实测打脸跑分:Qwen 3.8 27B 高分却常漏答多问提示

octagoncat23 · reddit · 2026-09-17

楼主表示越来越不信任 benchmark:Qwen 3.8 27B 在跑分上高于 Muse 30B,但他实测发现 Muse 在长上下文遵循和多步推理上呈指数级更好。

一个典型反例:在一条提示里问多个问题时,Qwen 约有一半时间只回答其中一个(通常是最难的那个),把大部分思考预算花在单一问题上——他猜测这是 benchmarkmaxxing(为刷分优化)的副产品。

楼主向社区征集:大家实测中哪些模型是被跑分热度埋没的「遗珠」?

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →