128GB M5 Mac 本地大模型实测:Qwen3.8-flash-next 90GB 内跑到 60 tok/s

surrealerthansurreal · reddit · 2026-10-06

作者基于一年真实编码、agentic 与游戏任务积累的 benchmark,测试 128GB 统一内存 M5 Mac 上的本地模型与运行时。结论:Qwen3.8-flash-next 量化后可塞进 90-95GB 内存,OMLX 运行时可达约 40 tok/s,MTPLX 调参后可达 60 tok/s;Qwen3.6 MOE 在 Splash 运行时上以约 120 tok/s 提供除编码外的大部分性能。详细数据与交互图表见其博客。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →