128GB M5 Mac 本地大模型实测:Qwen3.8-flash-next 90GB 内跑到 60 tok/s
surrealerthansurreal · reddit · 2026-10-06
作者基于一年真实编码、agentic 与游戏任务积累的 benchmark,测试 128GB 统一内存 M5 Mac 上的本地模型与运行时。结论:Qwen3.8-flash-next 量化后可塞进 90-95GB 内存,OMLX 运行时可达约 40 tok/s,MTPLX 调参后可达 60 tok/s;Qwen3.6 MOE 在 Splash 运行时上以约 120 tok/s 提供除编码外的大部分性能。详细数据与交互图表见其博客。
「Infra」频道最新
- AI 数据中心 2035 年或需 500GW,前英官员警告能源成最大瓶颈 — ShakeelHashim · 2026-10-06
- Starlink 在轨卫星超 1.1 万颗,占全球活跃卫星约三分之二 — XFreeze · 2026-10-06
- Ben Bajarin:Agentic AI 推动数据中心 CPU 需求,关键在 Scale-Up 域设计 — BenBajarin · 2026-10-06
- llama.cpp 作者:Qwen3.8-27B 用户可换 DFlash 投机解码再提速 — victormustar · 2026-10-06
- GLM 5.3 全量 NVFP4 可在 4 张 B200 或 H200 上部署 — TheZachMueller · 2026-10-06
- 网友把 GLM-5.3 无审查版量化成 MXFP4,AMD GPU 可跑 — bakatristan · 2026-10-06