M3 Ultra 本地跑 Qwen3.8-Flash-Next:预填充 559 t/s,解码 31 t/s

rm-rf-rm · reddit · 2026-09-14

Reddit 用户在 Apple M3 Ultra 上用 llama.cpp(经 llama-swap)本地运行 Qwen3.8-Flash-Next 的 Q4KXL GGUF 量化版,实测数据:pp1000 预填充速度约 558.83 t/s,500 token 解码生成速度约 31.05 t/s(峰值 31.67),首次响应时间约 3.3 秒。上下文配置为 256K,采样参数 --temp 1 --top-p 0.95 --top-k 20。测试工具为 llama-benchy,为本地部署 M3 Ultra 性能提供了具体参考数据。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →