12 张 RTX 3090 跑满 285B DeepSeek-V4-Flash,解码超 120 tok/s
ciprianveg · reddit · 2026-09-09
开发者 ciprianveg 发布了在消费级 Ampere 显卡上完整运行 DeepSeek-V4-Flash-Vision-Exp(285B MoE) 的方案:
- 模型为 FP4 experts + FP8 attention,权重约 157 GB,使用兼容 SM86 的 vLLM 构建
- 10 张 RTX 3090(TP2xPP5、240W 功耗上限)+ DSpark 投机解码(k=3)可达 60+ tok/s;12 张(TP4xPP3)可达 120+ tok/s
- 视觉输入、工具调用、投机解码全部可用;上下文支持 1M(无 offload)/ 4M(RAM offload),长上下文 prefill 约 3500 tok/s
项目完全可复现:提供预构建 Docker 镜像 ghcr.io/ciprianveg/3090-vllm:dsv4-flash-vision-sm86 和 GitHub 仓库(含构建指南、启动脚本和运行时补丁)。补丁覆盖 DSpark propose-gate、调度器多模态×投机解码行交叉、grammar-bitmask 校验、ViT OOM 修复、FlashInfer workspace-lane keying 等问题。
「Infra」频道最新
- IQE CEO:中国出口管制令铟磷衬底成半导体业关键风险 — pstAsiatech · 2026-09-09
- GTX 1660 Super 6GB 显卡够跑 ComfyUI 吗?作者求升级建议 — srthk97 · 2026-09-09
- 曝 DeepSeek 仅保留四款 V4 模型,欲通过精简版本来压低推理成本 — teortaxesTex · 2026-09-09
- OpenAI 风波后,有人提议为前沿 LLM 推理建可信执行环境 — Michael_D_Moor · 2026-09-09
- 在家跑价值 1 万美元的模型:Fireworks AI 工程师分享 agent 工作流 — David Ondrej · 2026-09-09
- 传 NVIDIA 以 12.9B 美元收购 Hugging Face,ZipNN 研究立功省 20% 存储 — LChoshen · 2026-09-09