128GB Mac Studio M5 Max 实测:Gemma 4 26B 134 tok/s 全对
TheOyinbooke · x · 2026-10-03
作者在 128GB 统一内存的 Mac Studio M5 Max(40 核 GPU)上实测 7 个 16GB 机器装不下的模型,与原 Gemma 3 4B 基线共 8 个模型横向对比,记录每秒 token 数、内存占用及 12 题严格测试(聊天、摘要、代码过隐藏测试、推理题)的正确数。
要点:
- Gemma 4 26B-A4B 是明显赢家:短答 134 tok/s、长摘要 123 tok/s,三轮全部 12/12 全对,且是唯一又快又全对的模型;模型仅 15.4GB。
- 两个 Splash 引擎模型速度更快(一个达 361 tok/s),但加载需要额外安装 LM Studio 的配套应用,且正确率不及。
- 测试标准严格:「快的错误答案仍是错误答案」,每个答案做 pass/fail 判定,四任务各跑三轮取中位数。
- 全部模型放在外置 SSD 上运行(共 222GB)。
「Infra」频道最新
- 软银 31 亿美元收购数据中心投资管理公司,扩建靠借债 — YvesMulkers · 2026-10-03
- Cloudflare 开源内部 AI 办公系统,GitHub 星标破 1 万 — ritakozlov · 2026-10-03
- CoreWeave 主动弃用「Neocloud」称号:我们早已不只是「新」 — DavidLinthicum · 2026-10-03
- 传博通筹 600 亿美元为 Anthropic 芯片买单,堪比芯片版分期付款 — ai · 2026-10-03
- Cua 开源 Spaces:给你的智能体一整个专用桌面 — TianbaoX · 2026-10-03
- 仅 10% 人口重度用 AI 就可能压垮推理基础设施,HBM 正疯狂短缺 — XFreeze · 2026-10-03