本地大模型的 prefill 吞吐是否被严重低估?
GabryIta · reddit · 2026-07-07
开发者指出,讨论本地运行 LLM 的 ROI 时几乎只关注解码(输出)速度,而忽视 prefill(输入)速度。以有人在 4 台 NVIDIA DGX Spark 上跑 GLM 5.2(4bit、投机解码等优化)为例,可实现约 60 输出 token/秒、6 并发,理论上 24/7 一天约 518 万输出 token,按 4.40 美元/百万输出 token 约合 22 美元/天;而同一配置的 prefill 吞吐约 3000 token/秒,是输出的约 50 倍。即便 prefill 单价更低(约 1.40 美元/百万输入 token),这种巨大吞吐差应显著影响 ROI,作者质疑业界为何很少将 prefill 纳入评估。
「Infra」频道最新
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11