M3 Max 本地跑出 70 tok/s,32k 任务后仍余 20GB 内存
mayfer · x · 2026-08-28
用户分享了在 M3 Max (128GB) 上本地运行大模型的实测数据。推理速度达到 70 tok/s,预填速度约为 300 tok/s。用户指出尽管机器过热时会有降频问题,但在执行 32k token 的 Agent 任务后,仍有 20GB 内存可用,认为该配置对于本地 Agent 开发非常实用。
所属事件:M3 Max 本地跑通 125B Qwen 模型,推理速度达 70tok/s(2 条相关)→
「编程与Agent」频道最新
- 谷歌 DeepMind 用 Teamwork 智能体攻克数学难题 — algo_diver · 2026-08-28
- 发布 Oxlint 配置 v2,新增规则确保 Agent 代码规范 — cnakazawa · 2026-08-28
- 过度工程反面教材:滥用 Docker 与无谓的安全约束 — burny_tech · 2026-08-28
- 实测 ChatGPT 桌面版替代摄影师编辑:效果惊人且省钱 — Ice2jc · 2026-08-28
- 视频解析:为何团队正收回 AI 编码栈控制权 — labeveryday · 2026-08-28
- Relay Harness 整合 204 个模型,支持全流程自动编码 Agent — realmeetjames · 2026-08-28