Qwen3.8-Flash-Next MTP 合入 ik_llama.cpp,5090 上速度翻倍至 90 tok/s
Alternative_Will5974 · reddit · 2026-09-04
- 作者的 MTP 支持已合入 ikllama.cpp 主线(PR #2369),无需 fork 补丁
- 模型自带 2.6B MTP 头,从隐状态起草 token 后验证;代码场景草稿接受率 93-99%,散文仅 60-65%
- 实测解码速度:RTX 5090+128GB(专家放 CPU)从 45 提升到 90 tok/s;RTX Pro 6000 上代码 85→113,但散文反而 83→59,并非免费午餐
- 12GB 4070 上代码 9.5→12.5,3090 可复现;草稿头与目标模型的配对很重要,某些组合净负收益
- 注意事项:目前仅支持单并发(-np 1),--jinja 会因默认开思考降低接受率
- 提供完整构建命令与 llama-server 启动参数,并给出三份 Hugging Face 上的 MTP 头权重文件
「Infra」频道最新
- 黄仁勋基金会出资,Marin 535B-A23B 开源模型训练完成 13% — dlwh · 2026-09-04
- ChatGPT 宕机时他用双 RTX 6000 Pro 本地跑 DeepSeek 剪视频 — HankYeomans · 2026-09-04
- AI 应用安装器 Pinokio 8.2.0 发布,新增万能磁盘清理功能 — cocktailpeanut · 2026-09-04
- 推理引擎被指是被忽视的攻击面,模型或可影响解码路径 — JeremyCMorgan · 2026-09-04
- browser-llm-fit:下载前先测模型能否在你的浏览器跑 — init0 · 2026-09-04
- YC S26 Demo Day 下周举行:漂浮数据中心、钻石半导体登场 — ycombinator · 2026-09-04