Qwen3.8-Flash-Next GGUF 版放出 MTP,多 token 预测有望显著提升本地 TPS
vini542reddit · reddit · 2026-09-01
社区为 Qwen3.8-Flash-Next 的 GGUF 量化版本放出了 MTP(Multi-Token Prediction,多 token 预测)支持。发帖人表示这有望显著提升本地推理的每秒 token 数(TPS),正等待测试。
目前还差 llama.cpp 侧的更多优化被合并,本地玩家即可受益。
「Infra」频道最新
- Milvus:云原生高性能向量数据库解析 — goyalshaliniuk · 2026-09-01
- Weaviate:支持对象与向量混合存储的数据库 — goyalshaliniuk · 2026-09-01
- 沙特 AI 公司合建红海 100 兆瓦数据中心 — Polymarket · 2026-09-01
- 32GB 内存+两块杂牌旧卡跑 Qwen3 27B,20t/s 本地编程可行但太慢 — pepijndevos · 2026-09-01
- 字节跳动 UBASE:万亿级向量数据的 AI 搜索引擎 — _reachsumit · 2026-09-01
- LinkedIn 提出基于 GPU 的语义检索框架 — _reachsumit · 2026-09-01