专题 · FULL STORY
Qwen3.8-27B:发布后的全民本地实测
Qwen3.8-27B 发布后,社区迅速掀起本地部署实测热潮:从 RTX 3090、双 3060 到 Mac 统一内存,开发者用 llama.cpp、MTP 投机解码等手段不断刷新推理速度,展示了该模型在消费级设备上的可用边界。
2026-08-14 ~ 2026-08-17 · 10 集 · 28 条
第 1 集 · 硬核实测多平台跑通2.4T参数Qwen模型(2026-08-14,3 条)
多位硬核开发者尝试在消费级设备上运行参数量高达 2.4T 的 Qwen 模型极限量化版。有开发者使用双 RTX 5090 与三张 RTX 5060Ti 组合,成功运行约 397GB 的模型,实测生成速度约为 0.8 tok/s;另有开发者借助 512GB 内存的 Mac Ultra,采用 1-bit 量化方案成功加载该模型,显存占用约 508GB,并完成了 SVG 生成等测试。这些实测证明了在顶级消费级硬件上跑通超大规模模型的可行性。
- RTX 5090+5060Ti极限跑2.4T模型,实测0.8 tok/s — mossy_troll_84 · 2026-08-14
- 5 张显卡也带不动:实测本地运行 Qwen 2.4T 量化版 — klicker0 · 2026-08-14
- Mac单机跑2.4T参数模型:1-bit量化实测与SVG生成测试 — Ok_Technology_5962 · 2026-08-14
第 2 集 · Qwen3.8-27B在RTX 6000上基准测试征集(2026-08-15,2 条)
Reddit用户发起针对Qwen3.8-27B在RTX 6000 Pro上的基准测试征集,涵盖vLLM全精度、FP8及BF16 TP2配置等多种性能数据。
- Qwen3.8-27B基准测试征集:RTX 6000 Pro + vLLM全精度与FP8 — HumanDrone8721 · 2026-08-15
- Qwen3.8-27B基准测试:BF16 TP2性能数据 — Maleficent_Bridge_41 · 2026-08-15
第 3 集 · 社区分享Qwen3.8-27B在32GB显存上的部署配置(2026-08-15,4 条)
社区分享了 Qwen3.8-27B 模型的多种部署配置。包括 ggerganov 提供的在 32GB 显存上使用 llama.cpp 运行的详细命令,以及 ggml-org 发布的 GGUF 量化模型,支持投机解码等优化。
- Qwen3.8-27B部署配置分享:DGX Spark vLLM与RTX 4090 llama.cpp — erdaltoprak · 2026-08-15
- llama.cpp 在 32GB 显存上运行 Qwen3 27B 的完整配置 — ggerganov · 2026-08-15
- llama.cpp 高级用法:32GB 显存跑 Qwen3.8 27B 并启用投机解码 — ggerganov · 2026-08-15
- ggml-org 发布 Qwen3.8-27B-GGUF,支持推理与智能体模式 — ggerganov · 2026-08-15
第 4 集 · RTX 3090 优化运行 Qwen3.8-27B 推理速度提升(2026-08-15,3 条)
用户在 RTX 3090 上运行 Qwen3.8-27B 量化版,速度达 34-36 tokens/s,显著高于此前版本。开发者通过移植 NInfer 运行时、启用 ReplaySSM 技术及优化 CUDA 图表,提升了运行效率。此外,社区还发布了针对双 3090 优化的 INT8 量化版。
- Qwen3.8-27B 推出双 3090 优化 INT8 量化版 — luedtek · 2026-08-15
- RTX 3090 跑 Qwen 3.8 27B 约 35 t/s — cviperr33 · 2026-08-15
- NInfer 实现 RTX 3090 高效运行 Qwen3.8-27B — mrmontanasagrada · 2026-08-15
第 5 集 · 双 RTX 3060 实测 Qwen3.8-27B 跑出 50 tok/s(2026-08-15,2 条)
Reddit 用户分享了在双 RTX 3060 12GB 显卡上运行 Qwen3.8-27B 的配置方案。通过使用 llama.cpp 和 MTP 投机解码技术,实测生成速度达到 50.6 tok/s,同时验证了模型的 CUDA 编程能力。
- Qwen3.8-27B在双RTX 3060上跑出40 tok/s,实测CUDA编程能力 — anderspitman · 2026-08-15
- 双 RTX 3060 跑 Qwen3.8-27B:50 tok/s 部署配方 — Ecstatic-Wash-7667 · 2026-08-15
第 6 集 · Qwen2.5模型本地性能评测(2026-08-15,2 条)
评测显示,Qwen2.5-72B模型在本地仅需16G显存即可运行,性能逼近Claude 3.5 Sonnet。另一评测称Qwen 2.5 27B在家用设备上运行仅需电费成本,表现媲美Opus。
- Qwen3.8 27B 家用实测:仅需电费成本性能比肩Opus — daniel_mac8 · 2026-08-15
- Qwen2.5-72B 本地性能逼近 Claude 3.5 Sonnet — AGI Hunt · 2026-08-15
第 7 集 · Qwen3.8-27B 多卡实测:3090极致优化672 tps(2026-08-16,6 条)
Qwen3.8-27B 模型发布后,社区针对不同显卡进行了密集的本地性能实测。RTX 3090 通过极致量化优化达到 672 tps,RTX 5090 与 RTX 6000 Pro 配合 SGLang 技术分别跑出 206 tok/s 与 223 tok/s 的高吞吐。在消费级主流显卡上,如 RTX 4090 和 4080 Super,模型在长上下文编码及日常生成任务中均表现出可用性。
已确认
- @iamMess 在 RTX 3090 上通过 W4A16 量化、FP8 KV Cache、lmhead 及 embedtokens 转 int8 等优化,将推理速度提升至 672 tps
- @StefanoGogioso 转述 SGLang 的 Day-0 支持:单张 RTX 5090 配合 NVFP4 量化与 DSpark 推测解码,解码速度达 206.1 tok/s
- @BanghuaZ 转述:RTX 6000 Pro(96GB)使用 SGLang 脚本、NVFP4 权重及 DSpark 推测解码,单流吞吐量为 200-223 tok/s
- @julianharris 在 RTX 4090 上使用 unsloth 4bit 量化实测,128k 上下文编码场景下速度为 73 tok/s;关闭思考模式后提速至 78 tok/s 但质量明显下降
- @BopSupreme 在 RTX 4080 Super(16GB)上全 GPU 卸载运行,速度约 39 tok/s,26K token 真实负载下约 34 tok/s
- @cocktailpeanut 转述用户 zast57:RTX 4090 经 Pinokio 一键部署 Ollama + OpenWebUI,运行 27B 模型在校对等文本任务中接近 100 tok/s
尚未确认
- @iamMess 提供的 672 tps 数据未明确区分是预填充还是解码速度,其测量口径与其他实测(两位数至两百出头)存在显著差异,待作者补充说明
为什么重要
- 极致优化案例(如 672 tps)与高端卡实测展示了该模型在硬件潜力上的上限,而中端显卡(如 4080 Super)的流畅运行证明其已具备广泛的本地部署可行性
- 思考模式的取舍实测为用户在本地部署时平衡速度与质量提供了直观参考
- 4090 本地跑 Qwen 27B:近100 token/s — cocktailpeanut · 2026-08-16
- RTX 6000 Pro 跑 Qwen3.8-27B 达 223 tok/s — BanghuaZ · 2026-08-17
- Qwen 3.8 27b本地编码实测:128k上下文73 tok/s,性能可用 — julianharris · 2026-08-17
- RTX 3090 跑 Qwen3.8-27B 达 672 tps,极致量化优化 — iamMess · 2026-08-17
- 单卡 5090 跑出每秒 206 token,Qwen3.8-27B 性能实测 — StefanoGogioso · 2026-08-17
- Qwen3.8 27B 在 RTX 4080 Super 上跑出 39 tok/s,本地编码够用 — BopSupreme · 2026-08-17
第 8 集 · Mac 跑本地 Agent 模型实测:内存决定可用性(2026-08-16,2 条)
苹果设备跑本地 Agent 模型引发社区讨论:Reddit 用户询问基础款 M4 Mac mini(16GB 统一内存)运行本地 Agent 模型的实际体验,关注工具调用、指令遵循、上下文长度与响应速度;另有用户在 64GB 内存的 Mac Studio 上实测 Qwen 2.5(27B/72B),采用社区 MLX 4bit 量化版本可获得可用性能,内存大小成为决定模型选择的关键。
- M4 Mac mini 16GB 内存跑本地 Agent 模型,哪些模型真正可用? — cuberhino · 2026-08-16
- Mac Studio 运行 Qwen 2.5 72B/27B 实测:性能与 Agent 表现 — Over_Technology_1764 · 2026-08-16
第 9 集 · RTX 3090 用户探讨 Qwen3 模型本地部署方案(2026-08-16,2 条)
多位拥有 RTX 3090 显卡的用户在 Reddit 上询问如何本地部署 Qwen3 系列模型。其中一位拥有 128GB 内存的新手关注是否必须使用 Linux 系统(对比 Windows),以及当前推荐的运行软件;另有用户讨论在单张 3090 有限显存下运行 Qwen3 模型的最佳配置,涉及 vLLM、llama.cpp 等不同推理引擎及相应优化设置,以在硬件限制下获得较优性能。
- 单 3090 显卡用户求 Qwen3 模型最佳本地部署配置 — sagiroth · 2026-08-16
- 手持 3090 显卡,如何入手本地部署 Qwen 3.8? — ozymandizz · 2026-08-17
第 10 集 · Qwen 3.8 27B本地实测表现稳定(2026-08-16,2 条)
开发者在RTX 3090和4090上测试了Qwen 3.8 27B模型。测试显示模型在4bit量化下运行稳定,支持128K长上下文,推理速度可达37至73 tok/s,自动压缩上下文且无明显报错,本地可用性较高。
- Qwen 3.8 27b 配 DeepSeek Harness 实测:10 小时稳定运行,37-60 tok/s — cviperr33 · 2026-08-16
- Qwen 3.8 27B本地编码实测:128K上下文73 tok/s,4bit量化流畅运行 — julianharris · 2026-08-17