双 DGX Spark 跑 DeepSeek-V4.1-Flash:TP2 补丁让首 token 从 33.8s 降至 4.9s
rez0__ · x · 2026-10-12
开源项目 DeepSeek-V4.1-Flash-2x-DGX-Spark 发布了在两台 NVIDIA GB10(DGX Spark)节点上用 TP2 运行 DeepSeek-V4.1-Flash(EXL3 2.9bpw)的引擎补丁与基准。效果:单流解码 code 90→99 tok/s、prose 56→61 tok/s,4 流 107→115 tok/s,prefill 提速 5-6%,agent 回放首 token 从 33.8s 降至 4.9s。
项目基于 24 小时真实编码 agent 流量(1853 个请求,中位 prompt 163K tokens,80% 已缓存)分析 prompt cache 表现:24% prefill 从保留状态恢复,40% 因带图请求完全不查缓存,34% 因保留状态被 KV 池覆盖而恢复失败,仅 2% 为真实 miss——约四分之三的 prefill 时间在做无用功。
「编程与Agent」频道最新
- Cloudflare 工程师提出执行阶梯:LLM 按任务动态升级运行环境 — irvinebroque · 2026-10-12
- Claude 队友 vs Codex 队友实测:一个像合作者爱质疑,一个像守纪工程师 — Sauers_ · 2026-10-12
- AI 写码更快了,为何交付没变快?瓶颈已转移到发布流程 — kristiyanstoyanovAI · 2026-10-12
- 企业 AI 部署现状:300 用户仅 5 人在用,客户痛点仍未解决 — Initial_Orange2985 · 2026-10-12
- 微软 Decision-1:为路由与编排而生的成本优化决策模型 — usamawahabkhan · 2026-10-12
- 不改模型权重也能进化:Browserbase 讲师演示浏览器 Agent 爬坡式自学 — AI Engineer · 2026-10-12