llama.cpp MTP 解码首次追平 ds4,GLM 5.3 Flash 在 Apple Silicon 跑出新纪录

challis88ocarina · reddit · 2026-10-08

Reddit 用户报告 llama.cpp 中的 MTP(Multi-Token Prediction)解码用 GLM 5.3 Flash 已能与 ds4(deep speculation 解码)竞争:尽管 prompt processing 仍偏慢,但这是首次有模型在 llama.cpp 上跑赢 ds4(且对方还用了 M3U 调优)。作者表示 MTP 在 Apple Silicon 上终于「有点用了」,并预告 Qwen38FN 将是真正的考验——目前 vanilla ds4 在其上只有约 65 t/s(并发 75 t/s)。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →