Qwen3.8 Flash 本地实测:M4 Max 跑 45 tok/s 接近 27B 速度
DerTomsn · reddit · 2026-09-06
- Reddit 用户用 llm-bench.io 实测 Qwen3.8 Flash Next 本地推理速度:M4 Max 达 45 tok/s,M2 Ultra 约 25 tok/s。
- 作者称其速度与 Qwen3.8 27B 在 Apple Silicon 上相当,说明小模型在端侧的可用性进一步提升。
「Infra」频道最新
- 实测推翻论文数据:DiffusionGemma 峰值吞吐实为 3k tok/s,约为论文 3 倍 — bodonoghue85 · 2026-09-06
- 推理时给预训练 LLM 加滑窗注意力,64K 上下文 KV 缓存仅 3.5MB — ahsaor8 · 2026-09-06
- 作者为 HF LLM 推理实现滑窗注意力,实测 32K 上下文 KV 缓存 3.5MB — ahsaor8 · 2026-09-06
- 做一个比价面板,帮你找到跑 MiniMax H3 最便宜的 GPU — CategoryFew5869 · 2026-09-06
- 16GB 显存跑 Qwen3.8 本地模型做村庄模拟游戏,75 t/s 出字 — Fancy-Snow7 · 2026-09-06
- 美国高尔夫球场年用水是全部数据中心总和的 30 倍 — MaxUnfried · 2026-09-06