DFlash2 投机解码提速 2.8 倍,Qwen3.8 三个本地版本实测横评

FantasticNature7590 · reddit · 2026-10-03

作者在单张 RTX PRO 6000(96GB)上对三个 Qwen3.8 本地构建做了同一套 10 项测试的横评:RadixArk 27B NVFP4(稠密)、orcarouter 27B Uncensored、RadixArk Flash-Next NVFP4(MoE),推理引擎用 SGLang v0.5.20 与 vLLM v0.29.0。

主要结论:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →