M3 Max 本地跑出 70 tok/s,32k 任务后仍余 20GB 内存

mayfer · x · 2026-08-28

用户分享了在 M3 Max (128GB) 上本地运行大模型的实测数据。推理速度达到 70 tok/s,预填速度约为 300 tok/s。用户指出尽管机器过热时会有降频问题,但在执行 32k token 的 Agent 任务后,仍有 20GB 内存可用,认为该配置对于本地 Agent 开发非常实用。

所属事件:M3 Max 本地跑通 125B Qwen 模型,推理速度达 70tok/s(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →