M2 Ultra 跑 DeepSeek V4 Flash:无损重打包至 141GiB,25.8 t/s 超 M3 Ultra
Agusx1211 · reddit · 2026-08-23
开发者针对 M2 Ultra(60 核、192GB)定制了 llama.cpp 分支,将 DeepSeek V4 Flash 无损重打包至 141 GiB,比公开 Q4 GGUF 更小(省出空间放上下文),且输出完全一致(无 KV cache 量化)。
关键成果:
- 速度达 25.8 t/s(峰值 42 t/s),甚至快过 M3 Ultra 上的 16 t/s
- 支持 SSD KV cache 与动态 lane,总上下文 1M token、8 lanes
- PP(prompt 处理)偏低,8k-32k 约 250 t/s,但 SSD cache 大幅弥补,作者认为仍有算力可挖
代码开源:llama-cpp-ds4f-m2-ultra。
「Infra」频道最新
- Codex 限流致旧方案不可用,Token 真实成本即将显现 — StewartalsopIII · 2026-08-23
- ShardFlow:跨广域网分布式推理 TPS 破 28 — katua_bkl · 2026-08-23
- Cursor 推出基于 S3 的大规模 Git 存储系统 — bibryam · 2026-08-23
- RTX 5090 跑通 Qwen 27B NVFP4:120 t/s 含视觉与 451K 缓存 — t4a8945 · 2026-08-23
- 发布 PromoteOps 工具:多云环境 CloudFormation 推送自动化 — iamthanoss · 2026-08-23
- NAS 启动失败复盘:元数据勿放启动盘 — TheZachMueller · 2026-08-23