Qwen3.8 27B xhigh 过度思考:23.8K token 换来碾压级效果
hiImMate · reddit · 2026-08-18
一位用户实测了 Qwen3.8 27B 不同思考档位(量化版 UDQ4XL),对比 DS V4 Flash、ChatGPT、Claude Opus 5 等,任务是用一句开放式提示词写一个苹果好处的 HTML 卡片。
- xhigh 档输出了 23.8K token 的思考,产出的卡片质量远超所有对手;medium 档只思考几百 token(794),结果平庸。
- DS V4 Flash 约 927 token,ChatGPT 与 Claude 也只轻量思考,效果均不及 xhigh。
- 作者再用一段明确描述设计细节的提示词(果园便签风、穿孔线、统计数据区等)测 medium 档:输出 3.3K token,快速产出了接近 xhigh 水准的结果。
结论:xhigh 会在简单提示词上「和自己较劲」般长思考,但换来显著更好的结果;若提示词足够具体,medium 档能大幅省 token 与时间且性能不俗,适合低吞吐(tps)环境。
所属事件:Qwen 3.8 27B 被指过度思考,实测派为深度推理正名(7 条相关)→
「模型」频道最新
- Sakana AI 推出日版推理模型 Namazu,支持 26 万上下文 — SakanaAILabs · 2026-08-18
- 开发者吐槽:强模型会「自造复杂度」,agent 产码仍难维护 — aiamblichus · 2026-08-18
- Grok 4.6 登顶代理法律评测亚军,成本为 GPT-5.6 十三分之一 — XFreeze · 2026-08-18
- Grok 太快太上头:重度账户 24 小时烧掉 30% 额度 — Daniel_Farinax · 2026-08-18
- J-Space 驱动 DeepSeek V4 Pro 多项基准分暴涨 — ccerrato147 · 2026-08-18
- Qwen 3.8 medium think 对比 3.6:谁值得分配思考预算? — deathcom65 · 2026-08-18