双卡跑满 DeepSeek V4-Flash 百万上下文:并发提升 1.5 倍
dee_hw · x · 2026-08-02
开发者纠正了此前关于 2× RTX PRO 6000 仅支持 131K 上下文 的推测,证实得益于 DeepSeek V4-Flash 的滑动窗口注意力(Sliding-window attention)机制,该配置完全可以运行完整的 1M 上下文窗口。
- 显存占用优化:1M 上下文并非物理一次性全部分配,实际 KV cache 仅需保留约 16K tokens 的物理占用。
- 性能实测:在原生 FP4 精度下,于 543K 深度成功通过大海捞针测试(Needle in a haystack)。
- 并发与延迟权衡:通过调低 numbatchedtokens 可将并发数提升至 1.52 倍,但代价是 prefill(预填充)时间从 11.9 秒大幅增加到 120.3 秒。
所属事件:DeepSeek-V4-Flash 本地部署实测:多硬件跑分与极限量化方案(14 条相关)→
「Infra」频道最新
- AMD 入局开源大模型:发布 Instella-MoE-16B 推理模型 — airesearch12 · 2026-08-03
- 美国多州拟取消数据中心税收优惠,AI算力成本或面临上升 — pstAsiatech · 2026-08-03
- 低显存跑视频模型太慢?开发者探讨 HuggingFace Pro 订阅的性价比 — Smooth-Telephone9443 · 2026-08-03
- AI 离线推理怎么做?开发者热议批量任务的最佳工程实践 — cmm324 · 2026-08-03
- AI 工程师必看:LLM 推理部署与优化 10 周实战路线图 — _jaydeepkarale · 2026-08-03
- 应用开发者应自研端侧模型:将算力下放给用户 — abacaj · 2026-08-03