Llama.cpp 新增自适应推测解码,提速 50%

Dutchnamn · reddit · 2026-08-25

Llama.cpp 的一个 Fork 引入了“自适应推测解码”功能,以优化 Qwen3.8 等密集模型的推理性能。传统的 MTP 和 DFlash 需要固定参数,但不同内容类型(如结构化内容)需要不同设置。该新功能允许设置最小和最大值,引擎会根据内容自动调整建议的 Token 数量。实测表明,在 Strix Halo 上生成结构化内容时,速度从 44 t/s 提升至 65 t/s,相比主线版本提升高达 50%。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →