专题 · FULL STORY

Qwen 3.8 27B:从跑分惊艳到争议修复

阿里开源 Qwen 3.8 27B 后,基准得分比肩顶级闭源模型引发关注,但社区随即质疑其「过度思考」与默认高温导致的胡言乱语,用户发现调低温度可修复,形成发布、争议到解决方案的事件线。

2026-08-17 ~ 2026-08-19 · 3 集 · 29 条

第 1 集 · Qwen 3.8 27B「过度思考」争议:实测多为性能代价(2026-08-17,7 条)

Qwen 3.8 27B 发布后在社区因默认生成大量推理 token 引发「过度思考」质疑,@emax 转述的网友吐槽代表了这波批评:模型表现很棒,但默认会想太多,实测推理 token 可高达 16K+。08-17 前后多位用户以实测为模型辩护,主流结论是:这种深度思考是性能逼近更大模型的必要代价而非低效,用户应调整使用预期而非否定模型本身。

已确认

  • @sukazu 实测对比 GLM 5.3、DeepSeek V4 Flash/Pro 等中国模型后认为 Qwen 3.8 27B 并非真的「过度思考」,尽管其推理 token 多于 3.6 版本。
  • @maxwell321 使用 3×3090 + Tesla P40 跑本地模型(Unsloth UD-Q8KXL 量化),结论是大量「思考」能挖出训练知识中的细枝末节,性能逼近 Claude Sonnet。
  • @AltruisticHeat9531 认为 16K+ 推理 token 是匹敌万亿参数模型的必要牺牲,并引用 Karpathy 的「tokens to think」理论,附 SWE-Rebench 对比数据。
  • @hiImMate 以 UDQ4XL 量化版实测不同思考档位,任务是用一句开放式提示词写苹果好处的 HTML 卡片:xhigh 档消耗 23.8K token,换来碾压 DS V4 Flash、ChatGPT、Claude Opus 5 等模型的效果。
  • @ResearchCrafty1804 指出闭源模型(如 Opus 5、GPT-5.6 Sol)内部计算量不透明,直接对比报告 token 数对开源模型不公平。
  • @wombweed 补充实操建议:在意响应速度可关闭思考或降低推理预算,出现循环可尝试更高量化等级;大量思考是 RL 训练下验证与深思的产物,正是高性能的来源。
  • @Afinetheorem 评测认为它是家用高性能 GPU 上可运行的最佳本地 LLM 之一,代码基准优异,但逻辑与视觉推理是测试过模型中最差之一,远不如 SOTA 模型(46/58)。

为什么重要

  • 讨论触及开源与闭源模型评估的不对称:开源模型的推理成本可被直接测量和批评,闭源模型可将计算成本隐藏在服务端。
  • 「推理 token 多是否等于低效」的争论为本地部署用户提供取舍参考:代码与生成类任务性价比高(@hiImMate 的实测显示高思考档位可换来更优产出);逻辑与视觉任务则需另选模型。

第 2 集 · Qwen3.8-27B 跑分比肩顶级闭源模型,单卡即可本地运行(2026-08-17,20 条)

Artificial Analysis 最新基准显示,阿里开源的 Qwen3.8-27B 综合得分达到 52,与 DeepSeek V4、GPT-5.6 Luna Max 等顶级闭源模型并驾齐驱,而它只需单张 RTX 3090 级别的消费级硬件(约 2000-3000 美元)即可本地运行。这被视为本地可跑的小模型首次在能力上基本追平最强闭源模型,社区将其称为本地模型的「DeepSeek 时刻」,是开源本地 AI 的重要里程碑。

已确认

  • Artificial Analysis 综合基准:Qwen3.8-27B 得分 52,与 DeepSeek V4、GPT-5.6 Luna Max 相当,超越四个月前的所有模型(含 Opus),硬件成本约 2000-3000 美元
  • Agentic Index 榜单(取各模型最大推理强度):Qwen3.8 Max 与 GPT-5.6-Sol 并列 58 分居首,Qwen3.8 27B 拿到 51 分,反超 GPT-5.6-Terra,并超越 GLM 5.2 和 DeepSeek V4 Pro 0813 等更大参数模型
  • 得分从前一版(38 分)跃升至 52;作为对比,MoE 架构的 Qwen 3.6 35B A3B 得分为 32,略低于 27B 版本
  • haider1 指出该模型为开源权重,智能指数 52 分基本等同于推理最大化设置下的 GPT-5.6 Luna;udmrzn 转发补充其支持在笔记本甚至浏览器中通过自定义 WebGPU 内核本地运行
  • 本地实测:remilouf 在 Mac Studio 上运行达到 63 tokens/s,体验流畅;appenz 测试显示可在 MacBook 上运行复杂智能体任务,并在某项基准中超越参数量大其约 50 倍的 DeepSeek V4 和 Opus 4.7
  • WonderRico 的本地 Agent 编程基准实测:Medium 模式下分数高于 3.6 版本,效率显著提升(请求量近乎减半,生成 tokens 减少三分之一),达到 DeepSeek v4 Flash 310 水平
  • 性能/规模比的量化分析:MikePFrank 与 enruben 分别基于 Artificial Analysis 得分与模型参数规模绘图,均显示 Qwen 27B 在性能与尺寸的比率上异常突出、显著偏离常规趋势;Hesamation 也指出 Qwen 70B 级模型位于尺寸-智能帕累托前沿的最左侧,接近顶尖 100B+ 模型的性能
  • pstAsiatech 转述该模型性能与 GPT-5.6 Luna 持平,成绩接近 DeepSeek 和智谱等国产模型;yacineMTB、ArnoStride 等用户普遍反馈其同尺寸表现「好得惊人」

尚未确认

  • AccBalanced 转发提到有推特用户质疑传播中的说法实为 Qwen 2.5 27B 超过 GPT-4.5、Gemini 2.5 Pro、Claude 4 Opus 等半年前 SOTA 的旧闻被误传(模型名与版本号均有讹误),但该说法与本次 08-17/08-18 集中出现的 Artificial Analysis 数据帖时间线不完全吻合,真伪待核实

为什么重要

  • Reddit 用户(anderspitman、yaboyyoungairvent 等)普遍认为,约 2000-3000 美元的硬件即可运行接近前沿性能的模型,大幅降低了顶级 AI 能力的获取门槛;InternationalGap3698 转述的社区讨论将其类比为本地模型的「DeepSeek 时刻」,认为其能力超越 Google 当前前沿模型且无需大型数据中心
  • EAccelerate42 指出其性能指标已可媲美 GLM5.2(800B)和 DeepSeek v4 pro(1.6T)级别的万亿参数大模型;Scobleizer 认为 Local AI 时代已经到来,本地开源模型已能处理绝大多数日常任务
  • 多张性能/参数规模散点图进一步印证该模型显著偏离历史尺寸-智能趋势线,引发社区对模型架构与 MoE 效率的热议(Gear5th 转述 27B 密集模型得分反超更大参数 MoE 版本)

第 3 集 · Qwen 3.8 默认高温引发胡言乱语,调低温度可修复(2026-08-18,2 条)

多位用户报告 Qwen 3.8(含 27B 版本)在默认 Temperature 1.0 下表现不佳:模型会在生成 1–2 万 token 后迅速退化,出现胡言乱语、句子中断或重复字符,简单任务也会输出冗长思考过程。将温度降至 0.7 可有效减少冗余,进一步降到 0.1 则可基本修复退化问题。