Llama.cpp 新增自适应推测解码,提速 50%
Dutchnamn · reddit · 2026-08-25
Llama.cpp 的一个 Fork 引入了“自适应推测解码”功能,以优化 Qwen3.8 等密集模型的推理性能。传统的 MTP 和 DFlash 需要固定参数,但不同内容类型(如结构化内容)需要不同设置。该新功能允许设置最小和最大值,引擎会根据内容自动调整建议的 Token 数量。实测表明,在 Strix Halo 上生成结构化内容时,速度从 44 t/s 提升至 65 t/s,相比主线版本提升高达 50%。
「Infra」频道最新
- 高盛:中国先进芯片自给率将升至 66% — pstAsiatech · 2026-08-25
- 量化感知修复:更快恢复 4 位压缩 LLM — MultiverseComputingCAI · 2026-08-25
- Vercel 数据:DeepSeek 推动开源模型份额升至 62% — pstAsiatech · 2026-08-25
- 观点:数据中心辩论揭示了浪费性实践 — _akpiper · 2026-08-25
- Marin:开源基础模型研究与开发框架 — marin-community · 2026-08-25
- 6000 欧元预算:AI 开发笔记本选 64-128GB 统一内存还是 CUDA — ClerkBeginning961 · 2026-08-25