M5 Ultra 96GB 本地跑 1.12 亿 token:聚合 3200 tok/s 预.fill 实测与定制 MLX 方案
Every-Fortune-3151 · reddit · 2026-09-24
作者用 64 核 GPU 的 M5 Ultra 96GB(基础款,顶配价格翻倍且要等到 2027)在本地跑 Qwen 3.8 FN 4/8-bit 混合量化,完成了累计 1.12 亿 token 的编码 agent 任务:4 路并发下聚合 prefill 约 3200 tok/s、decode 约 170 tok/s,单流中位 prefill 828 tok/s。编排层用 PC 上的 Qwen 27b,Mac 作为子 agent 推理服务器,总上下文 4×128k=512k,8-bit KV 共占用约 90GB 统一内存。
约 1700 次子 agent 调用、单请求上下文中位 64.4k,1.09 亿 prompt token 中缓存命中率高达 89%(9700 万),prompt caching 收益巨大。生成的自定义 mlx-serve(基于 strix halo lab 思路移植)包含四项优化:GDN 循环状态常驻 GPU 寄存器、4 流 HyperConnection+RMSNorm 融合为单次 Metal pass、稀疏 MoE tile 压缩丢弃 98.3% 零填充、按路由规律缓存 top-64 高频专家到 FP16 内存缓存(约 960MB)。
「编程与Agent」频道最新
- Codex 双智能体同时开发 iOS 与 Android 应用并提交商店上架 — burkov · 2026-09-24
- 《你对 AGENTS.md 的理解几乎为零》:一文讲透编码工具说明书之争 — dotey · 2026-09-24
- 60k token 强制换人实验:12 个 Terminal-Bench 任务 10 个仍通过 — key_of_door · 2026-09-24
- 独立开发者开源Tapioca:Go写的本地终端编码Agent — Practical_Witness_95 · 2026-09-24
- Anthropic 上线 Claude Marketplace:2000+ 连接器,可买第三方 Agent — claudeai · 2026-09-24
- 为多 Agent 并行而生:开发者发布 Mac 终端 Nyx,内置浏览器与 MCP — henrymodis · 2026-09-24