单台 DGX Spark 实测:124B 模型连续输出 1.5 万 token

AcanthisittaOk1699 · reddit · 2026-08-14

开发者在单台 DGX Spark 上使用社区 Q5 量化版的 Ling-3.0-flash(124B 参数)进行推理实测。在仅输入 33 个 token 提示词的情况下,模型在单次响应中连续生成了 15,128 个 token,耗时约 7 分钟。

最引人注目的数据是,在整个超长解码过程中,即使 KV cache 随着生成不断累积,模型的解码吞吐量依然极其稳定,从初期的 35.62 tok/s 仅微升至 35.68 tok/s,展现了极强的长文本推理稳定性。

所属事件:单台DGX Spark实测124B模型解码速度无损(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →