M3 Ultra 本地跑 Qwen3.8-Flash-Next:预填充 559 t/s,解码 31 t/s
rm-rf-rm · reddit · 2026-09-14
Reddit 用户在 Apple M3 Ultra 上用 llama.cpp(经 llama-swap)本地运行 Qwen3.8-Flash-Next 的 Q4KXL GGUF 量化版,实测数据:pp1000 预填充速度约 558.83 t/s,500 token 解码生成速度约 31.05 t/s(峰值 31.67),首次响应时间约 3.3 秒。上下文配置为 256K,采样参数 --temp 1 --top-p 0.95 --top-k 20。测试工具为 llama-benchy,为本地部署 M3 Ultra 性能提供了具体参考数据。
「Infra」频道最新
- Maia 200 每 1mm² 达约 12 TFLOP/s FP4,密度成第一设计目标 — thoefler · 2026-09-14
- 开发者晒 24/7 自托管 AI 栈:Open WebUI+Pidot+Tailscale 接 GLM/DeepSeek — andfanilo · 2026-09-14
- 网友揪出光子公司宣传图破绽:整张芯片图是镜像拼接的 — jwt0625 · 2026-09-14
- 工程师质疑 DeepSeek 带火的 inline PTX 热潮:写汇编不等于高性能 — mike64_t · 2026-09-14
- 新研究:LLM 强化学习训练可弃用 AdamW,标准 SGD 同样有效 — zhaoran_wang · 2026-09-14
- RTX 5090 现货几近断货,价格或将进一步失控 — DustNearby2848 · 2026-09-14