llama.cpp 集成 dflash2:Qwen 3.8 27B 推理提速至 3 倍
Top-Eye-8104 · reddit · 2026-08-20
用户在 RTX 6000 上测试了 llama.cpp 新增的 dflash2 功能(PR #27342),针对 Qwen 3.8 27B 模型进行了四种解码方案的对比:
中位数结果(4 个任务):
- Baseline: 47.4 tok/s
- MTP: 114.7 tok/s
- DFlash: 99.3 tok/s
- DFlash2: 140.6 tok/s
DFlash2 平均带来约 3 倍的性能提升,但在不同任务上表现不一,最低仅 1.5 倍增益,具体取决于任务特性。
「Infra」频道最新
- 终端工具 cmux 被曝内存占用过高 — DanielLockyer · 2026-08-20
- 劳登县靠数据中心暴富,居民担忧过度依赖 — AndyMasley · 2026-08-20
- 开发者单周 Token 调用量突破 10 亿 — jh3yy · 2026-08-20
- 数据中心建设遭邻避,视作反乌托邦背叛 — ai · 2026-08-20
- Dockerlings:终端交互式 Docker 练习工具 — tom_doerr · 2026-08-20
- oMLX 0.6.3rc1 发布:ANE Tuner 速度倍增,支持 DFlash 2 — alexcovo_eth · 2026-08-20