llama.cpp 支持 Qwen3-Next MTP,实现满速推理

jacek2023 · reddit · 2026-08-03

llama.cpp 最新合并的 PR #25589 为 Qwen3-Next 模型添加了 MTP(Multi-Token Prediction,多 Token 预测)支持。

这意味着开发者和用户现在可以在本地运行 Qwen3-Next 时达到“满速”推理状态,显著提升生成效率。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →