dotAI 演讲:llama.cpp 投机解码的 MTP、dflash 与 dspark 实践
ngxson · x · 2026-09-17
llama.cpp 贡献者 ngxson 宣布在 dotAI 大会上做了关于 llama.cpp 投机解码(speculative decoding)的演讲,涉及 MTP、dflash、dspark 等技术,回放即将上线。投机解码是 llama.cpp 加速本地推理的关键方向,对关注端侧部署与推理优化的开发者有参考价值。
「Infra」频道最新
- vLLM实战:如何在Agent多轮对话间保持前缀缓存热度 — bolts98 · 2026-09-17
- 2×5080跑Qwen3.8-Flash-Next:llama.cpp之外要不要换vLLM — whatyathinkk · 2026-09-17
- 黄仁勋:英伟达明年芯片销量将比今年翻一倍 — zephyr_z9 · 2026-09-17
- GlobalFoundries 与 Marvell 扩建佛蒙特厂,增产 AI 光互连芯片 — zephyr_z9 · 2026-09-17
- 26100 美元的桌面 AI 数据中心:双 RTX PRO 6000 开源工作站 — dee_hw · 2026-09-17
- 爆料称华为拟扩 4096 卡超节点,单节点 HBM 可达 384TB — zephyr_z9 · 2026-09-17