Qwen Flash Next MTP 工作重启,官方 GGUF 量化与 llama.cpp PR 上线
jacek2023 · reddit · 2026-10-01
Qwen Flash Next 的 MTP(多 token 预测)支持工作已重启。使用 llama.cpp 的用户可切换到 ggml-org 在 Hugging Face 上发布的 Qwen3.8-Flash-Next-GGUF 官方量化文件,对应功能通过 llama.cpp 的 PR #29761 合入,作者提醒目前仍是进行中(WIP)状态。对本地部署用户意味着 MTP 加速路径正在恢复。
「Infra」频道最新
- Arduino 称每节点远低于 Mac mini,嵌入式板卡改写 AI Agent 部署经济账 — CatAstro_Piyush · 2026-10-01
- SemiAnalysis 注入故障实测:GPU 集群租赁商可靠性差距悬殊 — AccBalanced · 2026-10-01
- Reddit网友跑DeepSeek无人值守循环:2.37亿token仅花3.48美元 — dogfoodarchitect · 2026-10-01
- 基于 Cornell 教程为团队自制 GPU 架构入门课程 — idanbeck · 2026-10-01
- Strata 采样参数冷知识:run 配置里可加 sampling 块设默认值 — KissMyShinyArse · 2026-10-01
- Meta 首个 Loop MoE Scaling Law:稀疏省 3 倍、循环省 2 倍算力 — facebook · 2026-10-01