Qwen3.8-27B 在 IGX Thor 与 Blackwell 上的实测
ahstanin · reddit · 2026-08-25
作者分享了在 NVIDIA IGX Thor 开发套件(配备 RTX PRO 6000 Blackwell Max-Q 96GB)上运行 Qwen3.8-27B-FP8 的详细基准测试结果。
主要发现:
- 推测解码(Speculative Decoding)效果显著:使用 DFlash2 草稿模型时,Batch 1 吞吐量提升 2.8 倍(126.3 vs 44.7 tok/s),TTFT 降低 3.3 倍。DFlash2 表现优于 EAGLE。
- SSM 状态精度陷阱:作为混合 Gated DeltaNet 模型,Qwen3.8 拥有额外的 GDN 状态池。将该状态设为 fp32 会耗尽显存,导致最大并发请求被静默限制在 21 个。切换为 bf16 可恢复全部 32 个并发并扩大 KV Cache,且在 GSM8K 评测中精度损失可忽略(93.5% vs 94.0%)。
- 推理模式延迟:开启推理(thinking)模式会带来约 137ms 的首字符延迟,语音场景建议关闭。
- 小模型上 iGPU 胜出:对比 RTX 6000 和 Thor iGPU 运行 STT/TTS,尽管 RTX 带宽更高,但 iGPU 在低延迟场景下表现更好。
「Infra」频道最新
- 三星先进芯片代工涨价最高 15%,中美客户需求激增 — Beth_Kindig · 2026-08-25
- 中国首创 AI 支付「了解你的代理」机制,规范智能体交易 — pstAsiatech · 2026-08-25
- agentic EDA 兴起:GPU 之外,CPU 大缓存与内存依然关键 — ai · 2026-08-25
- 谷歌微软后台更新占满资源,用户质疑电脑归属权 — NickPassig · 2026-08-25
- OpenAI 新推理引擎吞吐量实测:最高提升 4.1 倍 — rohanpaul_ai · 2026-08-25
- OpenAI 自研 Jalapeño 芯片:推理性能超越英伟达 GB200/GB300 — Polymarket · 2026-08-25