M5 Pro 64GB 本地跑 Qwen 实测:仅约 20 tok/s,长上下文更慢
rJohn420 · reddit · 2026-09-13
楼主分享 M5 Pro 64GB 本地运行大模型的体验:跑 Qwen 3 27B 左右可获得约 20 tok/s 的持续速度(前 2-4k token 约 30 tok/s),但模型思考量大导致实际体验偏慢;尝试 antirez 的 DS4 时,DeepSeek V4 Flash 持续速度只有约 8 tok/s,基本不可用。评论区征集同配置用户的本地模型选择。
「Infra」频道最新
- 在 Windows 上用 AMD GPU 跑 CUDA 工作负载,ROCm 讨论引关注 — Worried_Ad_1816 · 2026-09-14
- Reddit 展望:若 KVCache 优化普及,32GB 显存跑 54B 模型不是梦 — pmttyji · 2026-09-14
- 谷歌财报透露:AI 服务器回本周期不到 2 年,自研芯片仅一半 — Beth_Kindig · 2026-09-13
- 13 种注意力机制一文讲透:按瓶颈分类,从 MHA 到 FlashAttention — blaizedsouza · 2026-09-13
- 16GB 显存跑 Qwen 27B 提速:热插拔投机解码开源实现 — tsangberg · 2026-09-13
- Rene Haas:为何多数 AI 芯片创业公司注定失败 — No Priors · 2026-09-13