自建基准实测Qwen 3.8三变体:思考强度拉满基本白烧token

ColorsOfCosmos · reddit · 2026-10-11

一位 5060Ti 16GB 用户为选定日常模型,自建了一个迷你基准:以 AtCoder 近 30 天的 14 道新题为测试集(避免训练污染),基于 LiveCodeBench 搭测试框架,比较 Qwen 3.8 的三个变体——Swift 1.5 IQ2XS、Flash Next IQ3S、27B IQ3S,并横扫 none/low/medium/xhigh 四档思考强度,思考预算统一上限 32k token。全部测试跑了近 11 小时(AMD 7945HX + 64GB RAM + 5060Ti)。

核心发现:

结论:Flash IQ3S 是速度与准确率的最佳折中(med 档比 27B 多解一题,日常使用中也显得更聪明);27B 可靠但太慢,没有存在必要;日常用 medium,卡住再切 xhigh。作者也坦承样本量小、模型有随机性,数字仅供参考。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →