双 DGX Spark 跑 DeepSeek-V4.1-Flash:TP2 补丁让首 token 从 33.8s 降至 4.9s

rez0__ · x · 2026-10-12

开源项目 DeepSeek-V4.1-Flash-2x-DGX-Spark 发布了在两台 NVIDIA GB10(DGX Spark)节点上用 TP2 运行 DeepSeek-V4.1-Flash(EXL3 2.9bpw)的引擎补丁与基准。效果:单流解码 code 90→99 tok/s、prose 56→61 tok/s,4 流 107→115 tok/s,prefill 提速 5-6%,agent 回放首 token 从 33.8s 降至 4.9s。

项目基于 24 小时真实编码 agent 流量(1853 个请求,中位 prompt 163K tokens,80% 已缓存)分析 prompt cache 表现:24% prefill 从保留状态恢复,40% 因带图请求完全不查缓存,34% 因保留状态被 KV 池覆盖而恢复失败,仅 2% 为真实 miss——约四分之三的 prefill 时间在做无用功。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →