dotConf 演讲回放:用投机解码加速 llama.cpp 推理
ngxson · x · 2026-10-10
开发者 ngxson 在 dotConferences 的演讲回放发布,深入讲解投机解码(speculative decoding)及 dflash/dspark 方法如何提升 token 生成速度,并演示在 llama.cpp 中使用非常简单。对关注本地推理优化的开发者是实用的学习材料。
所属事件:dotConf 演讲回放:投机解码加速 llama.cpp 推理(2 条相关)→
「Infra」频道最新
- Datology 发布 Curation Studio,披露夏季数据筛选实验细节 — josh_wills · 2026-10-10
- 德累斯顿芯片厂或走无EUV路线,浸润式多重曝光可撑7nm — pstAsiatech · 2026-10-10
- 三星开源 LittleBit:13B 模型极限量化压进 1GB 内存 — udmrzn · 2026-10-10
- 分析师称 agentic CPU 研究与 NVIDIA Vera 基准结论一致,关注扩展路径之争 — BenBajarin · 2026-10-10
- Container 运行时 P95 延迟降至 731ms,两周再快 180ms — ritakozlov · 2026-10-10
- 亚马逊跟进微软宣布弃用数据中心交易保密协议,社区反对已致数百项暂停令 — TechCrunch AI · 2026-10-10