llama.cpp 支持 Qwen3-Next MTP,实现满速推理
jacek2023 · reddit · 2026-08-03
llama.cpp 最新合并的 PR #25589 为 Qwen3-Next 模型添加了 MTP(Multi-Token Prediction,多 Token 预测)支持。
这意味着开发者和用户现在可以在本地运行 Qwen3-Next 时达到“满速”推理状态,显著提升生成效率。
「Infra」频道最新
- Cloudflare 推出 @cloudflare/computer:为每个 Agent 配备专属计算环境 — threepointone · 2026-08-03
- Turso 数据库突破 SQLite 限制,正式支持并发写入 — glcst · 2026-08-03
- Cloudflare 详解大规模运行 Kimi 与 GLM 的推理优化 — michellechen · 2026-08-03
- Cloudflare 推出开源 Agent 运行时,让智能体按需调度容器与隔离环境 — Cloudflare Blog · 2026-08-03
- 中端显卡显存停滞惹众怒:英伟达被指刻意限制以保护 AI 高端线 — PROfil_Official · 2026-08-03
- MacBook Pro 跑 DeepSeek:量化后实测近 40 tokens/s — victormustar · 2026-08-03