DFlash 2 发布:MacBook 跑 Qwen3.8-27B 速达 70 tok/s
songhan_mit · x · 2026-08-19
Inco AI 发布 DFlash 2 推理加速技术。实测显示,在 M5 Max MacBook Pro 上运行 Qwen3.8-27B 模型时,速度可达 70 tok/s,相比自回归解码速度提升 4.6 倍,且输出质量保持一致。该技术在 Z Lab 孵化,通过在每个回合免费增加一个接受令牌来实现加速。
所属事件:Inco AI 推出 DFlash 2,Mac 推理提速最高 4.6 倍(3 条相关)→
「Infra」频道最新
- 为何消费级内存紧缺?服务器需求撞车 — davidmanheim · 2026-08-19
- 研究员预判:DDR5 将维持高价,DDR4 或在 DDR6 后回落 — davidmanheim · 2026-08-19
- Inco AI 推出 DFlash 2,推理提速最高 4.6 倍 — igilitschenski · 2026-08-19
- 未来能否在小显存 GPU 上运行 30B+ 参数的大模型? — absurdother · 2026-08-19
- Periodic Labs 基于 Miles 框架训练万亿参数模型,吞吐提速3倍 — hsu_byron · 2026-08-19
- 本地 LLM 速度瓶颈解析:4090 与 5090 性能差异 — Viktri1 · 2026-08-19