专题 · FULL STORY
Qwen 3.8 27B:从跑分惊艳到争议修复
阿里开源 Qwen 3.8 27B 后,基准得分比肩顶级闭源模型引发关注,但社区随即质疑其「过度思考」与默认高温导致的胡言乱语,用户发现调低温度可修复,形成发布、争议到解决方案的事件线。
2026-08-17 ~ 2026-08-19 · 3 集 · 29 条
第 1 集 · Qwen 3.8 27B「过度思考」争议:实测多为性能代价(2026-08-17,7 条)
Qwen 3.8 27B 发布后在社区因默认生成大量推理 token 引发「过度思考」质疑,@emax 转述的网友吐槽代表了这波批评:模型表现很棒,但默认会想太多,实测推理 token 可高达 16K+。08-17 前后多位用户以实测为模型辩护,主流结论是:这种深度思考是性能逼近更大模型的必要代价而非低效,用户应调整使用预期而非否定模型本身。
已确认
- @sukazu 实测对比 GLM 5.3、DeepSeek V4 Flash/Pro 等中国模型后认为 Qwen 3.8 27B 并非真的「过度思考」,尽管其推理 token 多于 3.6 版本。
- @maxwell321 使用 3×3090 + Tesla P40 跑本地模型(Unsloth UD-Q8KXL 量化),结论是大量「思考」能挖出训练知识中的细枝末节,性能逼近 Claude Sonnet。
- @AltruisticHeat9531 认为 16K+ 推理 token 是匹敌万亿参数模型的必要牺牲,并引用 Karpathy 的「tokens to think」理论,附 SWE-Rebench 对比数据。
- @hiImMate 以 UDQ4XL 量化版实测不同思考档位,任务是用一句开放式提示词写苹果好处的 HTML 卡片:xhigh 档消耗 23.8K token,换来碾压 DS V4 Flash、ChatGPT、Claude Opus 5 等模型的效果。
- @ResearchCrafty1804 指出闭源模型(如 Opus 5、GPT-5.6 Sol)内部计算量不透明,直接对比报告 token 数对开源模型不公平。
- @wombweed 补充实操建议:在意响应速度可关闭思考或降低推理预算,出现循环可尝试更高量化等级;大量思考是 RL 训练下验证与深思的产物,正是高性能的来源。
- @Afinetheorem 评测认为它是家用高性能 GPU 上可运行的最佳本地 LLM 之一,代码基准优异,但逻辑与视觉推理是测试过模型中最差之一,远不如 SOTA 模型(46/58)。
为什么重要
- 讨论触及开源与闭源模型评估的不对称:开源模型的推理成本可被直接测量和批评,闭源模型可将计算成本隐藏在服务端。
- 「推理 token 多是否等于低效」的争论为本地部署用户提供取舍参考:代码与生成类任务性价比高(@hiImMate 的实测显示高思考档位可换来更优产出);逻辑与视觉任务则需另选模型。
- 本地实测:Qwen 3.8 27B 靠「过度思考」逼近 Sonnet 水平 — maxwell321 · 2026-08-17
- 为何 Qwen 3.8 27b 并非过度思考?实测对比 GLM 与 DeepSeek — sukazu · 2026-08-17
- 网友吐槽 Qwen 3.8 27B 默认“想太多” — emax · 2026-08-17
- Qwen 3.8 27b 代码强逻辑弱,本地模型仍需取舍 — Afinetheorem · 2026-08-17
- Qwen 3.8 27B 暴耗 16K 推理 token 是合理的代价 — Altruistic_Heat_9531 · 2026-08-17
- Qwen 思考过多是特性而非Bug,需调整使用预期 — wombweed · 2026-08-18
- Qwen3.8 27B xhigh 过度思考:23.8K token 换来碾压级效果 — hiImMate · 2026-08-18
第 2 集 · Qwen3.8-27B 跑分比肩顶级闭源模型,单卡即可本地运行(2026-08-17,20 条)
Artificial Analysis 最新基准显示,阿里开源的 Qwen3.8-27B 综合得分达到 52,与 DeepSeek V4、GPT-5.6 Luna Max 等顶级闭源模型并驾齐驱,而它只需单张 RTX 3090 级别的消费级硬件(约 2000-3000 美元)即可本地运行。这被视为本地可跑的小模型首次在能力上基本追平最强闭源模型,社区将其称为本地模型的「DeepSeek 时刻」,是开源本地 AI 的重要里程碑。
已确认
- Artificial Analysis 综合基准:Qwen3.8-27B 得分 52,与 DeepSeek V4、GPT-5.6 Luna Max 相当,超越四个月前的所有模型(含 Opus),硬件成本约 2000-3000 美元
- Agentic Index 榜单(取各模型最大推理强度):Qwen3.8 Max 与 GPT-5.6-Sol 并列 58 分居首,Qwen3.8 27B 拿到 51 分,反超 GPT-5.6-Terra,并超越 GLM 5.2 和 DeepSeek V4 Pro 0813 等更大参数模型
- 得分从前一版(38 分)跃升至 52;作为对比,MoE 架构的 Qwen 3.6 35B A3B 得分为 32,略低于 27B 版本
- haider1 指出该模型为开源权重,智能指数 52 分基本等同于推理最大化设置下的 GPT-5.6 Luna;udmrzn 转发补充其支持在笔记本甚至浏览器中通过自定义 WebGPU 内核本地运行
- 本地实测:remilouf 在 Mac Studio 上运行达到 63 tokens/s,体验流畅;appenz 测试显示可在 MacBook 上运行复杂智能体任务,并在某项基准中超越参数量大其约 50 倍的 DeepSeek V4 和 Opus 4.7
- WonderRico 的本地 Agent 编程基准实测:Medium 模式下分数高于 3.6 版本,效率显著提升(请求量近乎减半,生成 tokens 减少三分之一),达到 DeepSeek v4 Flash 310 水平
- 性能/规模比的量化分析:MikePFrank 与 enruben 分别基于 Artificial Analysis 得分与模型参数规模绘图,均显示 Qwen 27B 在性能与尺寸的比率上异常突出、显著偏离常规趋势;Hesamation 也指出 Qwen 70B 级模型位于尺寸-智能帕累托前沿的最左侧,接近顶尖 100B+ 模型的性能
- pstAsiatech 转述该模型性能与 GPT-5.6 Luna 持平,成绩接近 DeepSeek 和智谱等国产模型;yacineMTB、ArnoStride 等用户普遍反馈其同尺寸表现「好得惊人」
尚未确认
- AccBalanced 转发提到有推特用户质疑传播中的说法实为 Qwen 2.5 27B 超过 GPT-4.5、Gemini 2.5 Pro、Claude 4 Opus 等半年前 SOTA 的旧闻被误传(模型名与版本号均有讹误),但该说法与本次 08-17/08-18 集中出现的 Artificial Analysis 数据帖时间线不完全吻合,真伪待核实
为什么重要
- Reddit 用户(anderspitman、yaboyyoungairvent 等)普遍认为,约 2000-3000 美元的硬件即可运行接近前沿性能的模型,大幅降低了顶级 AI 能力的获取门槛;InternationalGap3698 转述的社区讨论将其类比为本地模型的「DeepSeek 时刻」,认为其能力超越 Google 当前前沿模型且无需大型数据中心
- EAccelerate42 指出其性能指标已可媲美 GLM5.2(800B)和 DeepSeek v4 pro(1.6T)级别的万亿参数大模型;Scobleizer 认为 Local AI 时代已经到来,本地开源模型已能处理绝大多数日常任务
- 多张性能/参数规模散点图进一步印证该模型显著偏离历史尺寸-智能趋势线,引发社区对模型架构与 MoE 效率的热议(Gear5th 转述 27B 密集模型得分反超更大参数 MoE 版本)
- Mac Studio 跑 Qwen3.8-27B 速度达 63 tok/s — remilouf · 2026-08-17
- Qwen3.8-27B 基准测试与 DeepSeek V4、GPT-5.6 Luna Max 并驾齐驱 — anderspitman · 2026-08-18
- Qwen3.8-27B 性能逼近前沿,单张 3090 即可运行 — yaboyyoungairvent · 2026-08-18
- Qwen 3.8 27B 评分飙升,MoE 效率引发热议 — Gear5th · 2026-08-18
- Qwen3.8 27B 智能体得分反超 GPT-5.6-Terra,开源小模型再爆冷 — UnknownEssence · 2026-08-18
- Qwen3.8-27B 评测分超 52 — inductionheads · 2026-08-18
- 27B Qwen3.8 性能比肩万亿参数大模型 — EAccelerate_42 · 2026-08-18
- Qwen3.8 27B 跑赢大模型,Mac 本地实测惊艳 — appenz · 2026-08-18
- Qwen 3.8 27B 跑分 52,本地模型比肩顶级 — Scobleizer · 2026-08-18
- Qwen 3.8 27B 本地 Agent 编程基准实测 — WonderRico · 2026-08-18
- Qwen-3.8 27B 智能指数 52 分,媲美 GPT-5.6 Luna 顶配 — haider1 · 2026-08-18
- 通义千问 27B 排名超半年前 SOTA 模型 — AccBalanced · 2026-08-18
- Qwen 3.8 27B 跑分超 DeepSeek V4,成本仅 2-3k 美元 — LeviTurk · 2026-08-18
- 阿里轻量级 Qwen 评测匹敌 GPT-5.6 Luna — pstAsiatech · 2026-08-18
- Qwen3.8-27B 跑分 52 分,可在浏览器本地运行 — udmrzn · 2026-08-19
- Qwen 72B 模型打破算力性价比魔咒,重塑消费级硬件预期 — Hesamation · 2026-08-19
- 图表显示 Qwen3.8 同尺寸性能异常突出 — MikePFrank · 2026-08-19
- Qwen 27B 性能异军突起,远超同参数规模竞品 — enrub_en · 2026-08-19
- 新 Qwen 模型同尺寸下性能惊人 — yacineMTB · 2026-08-19
- 新 Qwen 模型表现惊艳,同级尺寸性能出众 — ArnoStride · 2026-08-19
第 3 集 · Qwen 3.8 默认高温引发胡言乱语,调低温度可修复(2026-08-18,2 条)
多位用户报告 Qwen 3.8(含 27B 版本)在默认 Temperature 1.0 下表现不佳:模型会在生成 1–2 万 token 后迅速退化,出现胡言乱语、句子中断或重复字符,简单任务也会输出冗长思考过程。将温度降至 0.7 可有效减少冗余,进一步降到 0.1 则可基本修复退化问题。
- Qwen3.8 默认温度过高?调参可大幅优化输出 — bSun0000 · 2026-08-18
- Qwen 3.8 默认高温导致胡言乱语,降至 0.1 可修复 — KeepyUpper · 2026-08-19