量化 MacBook 竟接近 DGX Spark
anvarazizov · reddit · 2026-07-18
作者用 Terminal-Bench 2.1 和 Terminus-2,对 DeepSeek-V4-Flash 做了两套本地系统对比:
- 1 台 M5 Max MacBook:80.8 GiB 的高度量化 GGUF,约 2.45 bit/weight
- 2× DGX Spark:原生 FP8/FP4 checkpoint,带 DSpark speculative decoding
结果显示:
- MacBook:47/87 = 54.0%
- 2× DGX Spark:45/86 = 52.3%
- 在两边都可评分的 86 个任务里,双方结论一致的有 66 个
- 分歧任务 20 个,Mac-only 11 个,Spark-only 9 个
作者强调这不能证明 2-bit 量化是“免费午餐”,因为两边并非严格控制变量:硬件、KV 形式、上下文上限、运行时、以及 Spark 侧的 speculative decoding 都不同。更准确地说,这是对两套“完整系统”的端到端比较,而不是纯量化消融。
「Infra」频道最新
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11