自建基准实测Qwen 3.8三变体:思考强度拉满基本白烧token
ColorsOfCosmos · reddit · 2026-10-11
一位 5060Ti 16GB 用户为选定日常模型,自建了一个迷你基准:以 AtCoder 近 30 天的 14 道新题为测试集(避免训练污染),基于 LiveCodeBench 搭测试框架,比较 Qwen 3.8 的三个变体——Swift 1.5 IQ2XS、Flash Next IQ3S、27B IQ3S,并横扫 none/low/medium/xhigh 四档思考强度,思考预算统一上限 32k token。全部测试跑了近 11 小时(AMD 7945HX + 64GB RAM + 5060Ti)。
核心发现:
- 思考强度提升基本不带来解题数增长——三个模型都在 low 档成绩的 ±2 题内浮动,且无一从 low→med→xhi 单调提升(Flash 峰值在 med 解 11 题,Swift 在 xhi 解 10 题,27B 恒定 10 题)。
- 提高强度买到的主要是 CAP(撞 32k 上限):各模型 CAP 数随强度上升而增加,耗时增长 33-57%,多花的思考 token 大多烧在本来就不会做的题上。
- 唯一稳定劣化的是关掉思考:DNF(无输出代码)只出现在 none 档,ERR 也显著跳升。
结论:Flash IQ3S 是速度与准确率的最佳折中(med 档比 27B 多解一题,日常使用中也显得更聪明);27B 可靠但太慢,没有存在必要;日常用 medium,卡住再切 xhigh。作者也坦承样本量小、模型有随机性,数字仅供参考。
「模型」频道最新
- 观察:不指定颜色时 Claude 默认爱用 Anthropic 橙 — deanwball · 2026-10-11
- 曝 Gemini 4 Argon 推迟至 10 月 20 日发布,来源未经证实 — ThePrimeNumbers · 2026-10-11
- 1M 上下文是纸面数字:模型有效上下文受内部维度限制远低于标称 — AlexTensor · 2026-10-11
- 谷歌搜索连Taylor Swift歌词都拦,自动化安全护栏被批过于粗暴 — evijit · 2026-10-11
- OpenAI 教育版合同期内砍半用量,斯坦福用户人均已付 600 美元 — RexDouglass · 2026-10-11
- Musk 谈收购 Cursor:数据、人才、算力加企业销售缺一不可 — ns123abc · 2026-10-11