单台 DGX Spark 实测:124B 模型连续输出 1.5 万 token
AcanthisittaOk1699 · reddit · 2026-08-14
开发者在单台 DGX Spark 上使用社区 Q5 量化版的 Ling-3.0-flash(124B 参数)进行推理实测。在仅输入 33 个 token 提示词的情况下,模型在单次响应中连续生成了 15,128 个 token,耗时约 7 分钟。
最引人注目的数据是,在整个超长解码过程中,即使 KV cache 随着生成不断累积,模型的解码吞吐量依然极其稳定,从初期的 35.62 tok/s 仅微升至 35.68 tok/s,展现了极强的长文本推理稳定性。
所属事件:单台DGX Spark实测124B模型解码速度无损(2 条相关)→
「Infra」频道最新
- 计算机系统新前沿:多机共享内存的无限可能与挑战 — lauriewired · 2026-08-14
- Cerebras推出GPT-5.6 Sol超快模式,速度达750 tokens/s — kimmonismus · 2026-08-14
- OpenAI 预览 Ultrafast 模式:GPT-5.6 Sol 推理速度飙升 14 倍 — OpenAI · 2026-08-14
- 如何用机器学习与硬件计数器检测性能回归? — ZeroDark_Hereford · 2026-08-14
- Polymarket押注英伟达年底市值登顶,概率高达73% — Polymarket · 2026-08-14
- 驳斥AI数据中心七大流言:耗水、推高电价纯属无稽之谈 — Dan_Jeffries1 · 2026-08-14