DFlash2 投机解码提速 2.8 倍,Qwen3.8 三个本地版本实测横评
FantasticNature7590 · reddit · 2026-10-03
作者在单张 RTX PRO 6000(96GB)上对三个 Qwen3.8 本地构建做了同一套 10 项测试的横评:RadixArk 27B NVFP4(稠密)、orcarouter 27B Uncensored、RadixArk Flash-Next NVFP4(MoE),推理引擎用 SGLang v0.5.20 与 vLLM v0.29.0。
主要结论:
- 速度:27B 上接 DFlash2 投机解码 drafter 后,Spec-Bench 单用户从 75 提到 210 tok/s(2.8×);DFlash2 在两台引擎上都胜出(每步约 3.7 个草稿 token vs MTP 的 2.9)。长窗口 prefill:Flash-Next 22.4s,27B 97s,Uncensored 99s。BF16 全精度版只有 97 tok/s,量化收益明显。
- 引擎对比:SGLang 总体更快,但主要差异来自 checkpoint;同一导出在 vLLM 上反而快 16%(169 vs 146 tok/s)。
- 能力:10 项测试 Flash-Next 赢 5 项、27B 赢 4 项;工具调用(BFCL 子集)27B 73.3% > Uncensored 70.8% > Flash-Next 64.5%。Battle arena 上 27B 得 700/1000,高于 Claude Fable 5.1(678)和 GPT-5.6(473)。Rube Goldberg 测试只有 Flash-Next 完成任务,两个 27B 把 11 万 token 预算全花在思考上。
- 4 用户并发下 RadixArk NVFP4 + DFlash2 总吞吐 607 tok/s。
「Infra」频道最新
- 布科夫:生成式AI只有卖GPU的在赚钱,重演互联网泡沫 — burkov · 2026-10-03
- 从抽象表示直接推导 KV-cache 位置,prefill 与推理形式可互通 — vtabbott_ · 2026-10-03
- 黄仁勋早已不止卖 GPU:NVIDIA 从 CUDA 一路铺到物理 AI — sudoraohacker · 2026-10-03
- Nvidia 护城河之争:软件栈与互操作性,还是供应链网络效应? — QuintinPope5 · 2026-10-03
- Cerebras CEO 揭秘:晶圆级架构推理为何比 GPU 快 2500 倍 — rohanpaul_ai · 2026-10-03
- Cerebras CEO 晒自建 42MW 发电机组,算力电力一体化再进一步 — dunkhippo33 · 2026-10-03