专题 · FULL STORY

Qwen3.8-27B:发布后的全民本地实测

Qwen3.8-27B 发布后,社区迅速掀起本地部署实测热潮:从 RTX 3090、双 3060 到 Mac 统一内存,开发者用 llama.cpp、MTP 投机解码等手段不断刷新推理速度,展示了该模型在消费级设备上的可用边界。

2026-08-14 ~ 2026-08-17 · 10 集 · 28 条

第 1 集 · 硬核实测多平台跑通2.4T参数Qwen模型(2026-08-14,3 条)

多位硬核开发者尝试在消费级设备上运行参数量高达 2.4T 的 Qwen 模型极限量化版。有开发者使用双 RTX 5090 与三张 RTX 5060Ti 组合,成功运行约 397GB 的模型,实测生成速度约为 0.8 tok/s;另有开发者借助 512GB 内存的 Mac Ultra,采用 1-bit 量化方案成功加载该模型,显存占用约 508GB,并完成了 SVG 生成等测试。这些实测证明了在顶级消费级硬件上跑通超大规模模型的可行性。

第 2 集 · Qwen3.8-27B在RTX 6000上基准测试征集(2026-08-15,2 条)

Reddit用户发起针对Qwen3.8-27B在RTX 6000 Pro上的基准测试征集,涵盖vLLM全精度、FP8及BF16 TP2配置等多种性能数据。

第 3 集 · 社区分享Qwen3.8-27B在32GB显存上的部署配置(2026-08-15,4 条)

社区分享了 Qwen3.8-27B 模型的多种部署配置。包括 ggerganov 提供的在 32GB 显存上使用 llama.cpp 运行的详细命令,以及 ggml-org 发布的 GGUF 量化模型,支持投机解码等优化。

第 4 集 · RTX 3090 优化运行 Qwen3.8-27B 推理速度提升(2026-08-15,3 条)

用户在 RTX 3090 上运行 Qwen3.8-27B 量化版,速度达 34-36 tokens/s,显著高于此前版本。开发者通过移植 NInfer 运行时、启用 ReplaySSM 技术及优化 CUDA 图表,提升了运行效率。此外,社区还发布了针对双 3090 优化的 INT8 量化版。

第 5 集 · 双 RTX 3060 实测 Qwen3.8-27B 跑出 50 tok/s(2026-08-15,2 条)

Reddit 用户分享了在双 RTX 3060 12GB 显卡上运行 Qwen3.8-27B 的配置方案。通过使用 llama.cpp 和 MTP 投机解码技术,实测生成速度达到 50.6 tok/s,同时验证了模型的 CUDA 编程能力。

第 6 集 · Qwen2.5模型本地性能评测(2026-08-15,2 条)

评测显示,Qwen2.5-72B模型在本地仅需16G显存即可运行,性能逼近Claude 3.5 Sonnet。另一评测称Qwen 2.5 27B在家用设备上运行仅需电费成本,表现媲美Opus。

第 7 集 · Qwen3.8-27B 多卡实测:3090极致优化672 tps(2026-08-16,6 条)

Qwen3.8-27B 模型发布后,社区针对不同显卡进行了密集的本地性能实测。RTX 3090 通过极致量化优化达到 672 tps,RTX 5090 与 RTX 6000 Pro 配合 SGLang 技术分别跑出 206 tok/s 与 223 tok/s 的高吞吐。在消费级主流显卡上,如 RTX 4090 和 4080 Super,模型在长上下文编码及日常生成任务中均表现出可用性。

已确认

  • @iamMess 在 RTX 3090 上通过 W4A16 量化、FP8 KV Cache、lmhead 及 embedtokens 转 int8 等优化,将推理速度提升至 672 tps
  • @StefanoGogioso 转述 SGLang 的 Day-0 支持:单张 RTX 5090 配合 NVFP4 量化与 DSpark 推测解码,解码速度达 206.1 tok/s
  • @BanghuaZ 转述:RTX 6000 Pro(96GB)使用 SGLang 脚本、NVFP4 权重及 DSpark 推测解码,单流吞吐量为 200-223 tok/s
  • @julianharris 在 RTX 4090 上使用 unsloth 4bit 量化实测,128k 上下文编码场景下速度为 73 tok/s;关闭思考模式后提速至 78 tok/s 但质量明显下降
  • @BopSupreme 在 RTX 4080 Super(16GB)上全 GPU 卸载运行,速度约 39 tok/s,26K token 真实负载下约 34 tok/s
  • @cocktailpeanut 转述用户 zast57:RTX 4090 经 Pinokio 一键部署 Ollama + OpenWebUI,运行 27B 模型在校对等文本任务中接近 100 tok/s

尚未确认

  • @iamMess 提供的 672 tps 数据未明确区分是预填充还是解码速度,其测量口径与其他实测(两位数至两百出头)存在显著差异,待作者补充说明

为什么重要

  • 极致优化案例(如 672 tps)与高端卡实测展示了该模型在硬件潜力上的上限,而中端显卡(如 4080 Super)的流畅运行证明其已具备广泛的本地部署可行性
  • 思考模式的取舍实测为用户在本地部署时平衡速度与质量提供了直观参考

第 8 集 · Mac 跑本地 Agent 模型实测:内存决定可用性(2026-08-16,2 条)

苹果设备跑本地 Agent 模型引发社区讨论:Reddit 用户询问基础款 M4 Mac mini(16GB 统一内存)运行本地 Agent 模型的实际体验,关注工具调用、指令遵循、上下文长度与响应速度;另有用户在 64GB 内存的 Mac Studio 上实测 Qwen 2.5(27B/72B),采用社区 MLX 4bit 量化版本可获得可用性能,内存大小成为决定模型选择的关键。

第 9 集 · RTX 3090 用户探讨 Qwen3 模型本地部署方案(2026-08-16,2 条)

多位拥有 RTX 3090 显卡的用户在 Reddit 上询问如何本地部署 Qwen3 系列模型。其中一位拥有 128GB 内存的新手关注是否必须使用 Linux 系统(对比 Windows),以及当前推荐的运行软件;另有用户讨论在单张 3090 有限显存下运行 Qwen3 模型的最佳配置,涉及 vLLM、llama.cpp 等不同推理引擎及相应优化设置,以在硬件限制下获得较优性能。

第 10 集 · Qwen 3.8 27B本地实测表现稳定(2026-08-16,2 条)

开发者在RTX 3090和4090上测试了Qwen 3.8 27B模型。测试显示模型在4bit量化下运行稳定,支持128K长上下文,推理速度可达37至73 tok/s,自动压缩上下文且无明显报错,本地可用性较高。