实测 DFlash2 加速 Qwen3.8 27B:代码提速至 200tk/s

Hefty_Wolverine_553 · reddit · 2026-08-19

Reddit 用户在 RTX 5090 上实测了 Inco AI 发布的 DFlash2 推理加速技术(配合 Qwen3.8 27B GGUF 模型)。测试显示,在生成代码时,DFlash2 相比之前的 MTP 提速明显,短时爆发可达约 200 tokens/s,整体单次代码生成请求平均约 120 tokens/s(此前 MTP 平均约 140 tokens/s)。但在思考类任务中速度略降至 80-90 tokens/s。副作用是显存占用增加,上下文长度需从 220k 降至 160k。作者提供了一套详细的启动参数配置。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →