llama.cpp 合入 PR 为 Qwen Flash Next 添加 MTP 支持,量化已上架
jacek2023 · reddit · 2026-10-01
GitHub 用户 am17an 向 ggml-org/llama.cpp 提交并合入了 Qwen4Exp PR(#29761),为 Qwen Flash Next 添加 MTP(多 token 预测)支持,本地推理速度可进一步提升。配套的 GGUF 量化版本已发布在 Hugging Face(ggml-org/Qwen3.8-Flash-Next-GGUF),作者戏称是从 Qwen 3.8 27B 换机的时机到了。
「Infra」频道最新
- CUDA matmul 优化教程:从朴素 kernel 一步步逼近 cuBLAS 94% 性能 — Abhishekcur · 2026-10-01
- 美光展望到 2028:存储供给持续紧张,已签 26 份长约锁定 1500 亿美元 — firstadopter · 2026-10-01
- Oracle 财报暴涨:被戏称为美国最大「中国云」的 OCI — kevinsxu · 2026-10-01
- 内存涨价致 2GB 树莓派 4/5 再涨 12.5 美元 — jedisct1 · 2026-10-01
- Turso Cloud 新增澳巴加瑞四个区域,依托 S3 Express 架构达 10 个 AWS 区域 — glcst · 2026-10-01
- 在 1990 年的 286 电脑上跑满功能 AI 聊天与生图:9 秒出图,开源 — jacobpederson · 2026-10-01