DGX Spark 实测:DeepSeek V4 Flash 跑通 90 万 token 长提示
jtsaint333 · reddit · 2026-08-29
作者用 4 台 DGX Spark(两组 ConnectX-7 对)实测多款新模型的本地方案,结果为本地一手数据:
- DeepSeek V4 Flash(2 卡 TP2 + vLLM、NVFP4 MLA KV、MTP5)实现 1M 服务上下文,实测通过 899,994 token 的提示词,但速度不占优,high thinking 下 24 题批次耗时超 1 小时、成功率掉到 20/24。
- Qwen3.8 Flash Next 表现最佳:medium thinking 拿到 22/24 最高分,off 模式仅 1:22 完成全批且输出极简(8,861 token)。
- Qwen3.8-27B off 模式吞吐最高(190 delivered tok/s),low thinking 多花 3.82 倍时间只换来多对一题。
- Qwen3.6-35B-A3B 单卡可达 c16 并发 784 tok/s 聚合吞吐,32K 上下文下 12 题编程子集 11/12。
操作层面的结论比单次分数更有价值:高/超高 thinking 档在这个任务集上是反效果——xhigh 输出 token 是 medium 的 3 倍多反而分数更低;DeepSeek high 同样更差。作者强调这些是部署参考点,不是架构归一化的排行榜。
「Infra」频道最新
- AI 延迟不止在模型:全链路 19 种模式即将发布 — bibryam · 2026-08-29
- 个人研究者租GPU越来越难,Jarvislabs 推按需 H200 集群 — algo_diver · 2026-08-29
- 3.1万条小时级评测:模型跨天波动 8.4 分,是日内波动 3 倍 — ionutvi · 2026-08-29
- 优化 AI 全链路延迟的四种实践方法 — bibryam · 2026-08-29
- 性能优化案例:延迟从 8ms 降至 0.87ms — DanielLockyer · 2026-08-29
- AutoFAB 用机器人手臂接管 3D 打印机,实现 24/7 无人生产 — TinfoilTricorn · 2026-08-29