DFlash 2 发布:苹果 M5 Max 跑 Qwen3.8-27B 达 70 tok/s
Lianhuiq · x · 2026-08-19
Inco AI 发布 DFlash 2 推理优化技术。演示显示,Qwen3.8-27B 在 M5 Max MacBook Pro 上达到 70 tok/s,速度是自回归解码的 4.6 倍。
核心改进:
- 在约 1% 的延迟开销下,每次验证 pass 的输出增加 20% 以上。
- 通过并行起草整个 token 块,而非传统的逐 token 自回归起草。
- 生态系统支持广泛,已被 NVIDIA、Google、CoreWeave 等集成。
所属事件:Inco AI 推出 DFlash 2,Mac 推理提速最高 4.6 倍(3 条相关)→
「Infra」频道最新
- 本地跑 AI Bot 噪音有多大?实测风扇狂转如喷气 — Daniel_Farinax · 2026-08-19
- 16GB M5 MacBook Air 跑 MiniMax H3:VPipe 比 h3.c 快 25% — TgoAI · 2026-08-19
- 英伟达垄断难破?唯有计算范式变革才能突围 — 2C_ornot2C · 2026-08-19
- Anthropic 的 Astra 推理多级监控机制曝光 — AccBalanced · 2026-08-19
- Brex 报告:AI 热潮赢家是基础设施而非应用 — simonguozirui · 2026-08-19
- Alchemy 作者:面向 Agent 时代的极简云基础设施工具 — samgoodwin89 · 2026-08-19