实测 DFlash2 加速 Qwen3.8 27B:代码提速至 200tk/s
Hefty_Wolverine_553 · reddit · 2026-08-19
Reddit 用户在 RTX 5090 上实测了 Inco AI 发布的 DFlash2 推理加速技术(配合 Qwen3.8 27B GGUF 模型)。测试显示,在生成代码时,DFlash2 相比之前的 MTP 提速明显,短时爆发可达约 200 tokens/s,整体单次代码生成请求平均约 120 tokens/s(此前 MTP 平均约 140 tokens/s)。但在思考类任务中速度略降至 80-90 tokens/s。副作用是显存占用增加,上下文长度需从 220k 降至 160k。作者提供了一套详细的启动参数配置。
「Infra」频道最新
- 开源 RL 框架 Miles v0.1 发布,简化大模型强化学习训练 — ying11231 · 2026-08-19
- 同文不同价:OpenAI 专家揭秘分词器差异如何致 API 账单差三成 — 新智元 · 2026-08-19
- GitHub流量爆增或因Agent泛滥,仅付费托管恐非解药 — steipete · 2026-08-19
- 代码审查吞噬 SDLC 超一半算力,多智能体系统存隐形成本 — rseroter · 2026-08-19
- 开发者正在修复 Vercel AI Gateway 的模型兼容性问题 — jasonkneen · 2026-08-19
- 英伟达发布多 GPU 方案:分钟级运行大规模 UMAP — leland_mcinnes · 2026-08-19