dotConf 演讲回放:用投机解码加速 llama.cpp 推理

ngxson · x · 2026-10-10

开发者 ngxson 在 dotConferences 的演讲回放发布,深入讲解投机解码(speculative decoding)及 dflash/dspark 方法如何提升 token 生成速度,并演示在 llama.cpp 中使用非常简单。对关注本地推理优化的开发者是实用的学习材料。

所属事件:dotConf 演讲回放:投机解码加速 llama.cpp 推理(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →