llama.cpp MTP 解码首次追平 ds4,GLM 5.3 Flash 在 Apple Silicon 跑出新纪录
challis88ocarina · reddit · 2026-10-08
Reddit 用户报告 llama.cpp 中的 MTP(Multi-Token Prediction)解码用 GLM 5.3 Flash 已能与 ds4(deep speculation 解码)竞争:尽管 prompt processing 仍偏慢,但这是首次有模型在 llama.cpp 上跑赢 ds4(且对方还用了 M3U 调优)。作者表示 MTP 在 Apple Silicon 上终于「有点用了」,并预告 Qwen38FN 将是真正的考验——目前 vanilla ds4 在其上只有约 65 t/s(并发 75 t/s)。
「Infra」频道最新
- 腾讯开源 STEPQuant:6-bit 递归状态省 68.7% 推理内存不失精度 — _akhaliq · 2026-10-09
- Bain 预测 2030 年全球 GPU/定制芯片出货 3860 万片,为 2023 年 10 倍 — Beth_Kindig · 2026-10-09
- 多团队共享 GPU 集群:AWS 发布 HyperPod 多租户参考架构 — AWS ML Blog · 2026-10-09
- Mistral 被指弃用核电转用七成煤电数据中心训练开源模型 — wavefnx · 2026-10-09
- 为什么每轮都把完整对话发给推理服务器?Reddit 热议服务端 KV 槽位 API 设想 — Vasili_Sk · 2026-10-09
- NVIDIA NeMo-DCR:1T 模型权重同步从 87.5 分钟压缩到 150 秒,提速最多 40 倍 — dair_ai · 2026-10-09