4 块 RTX Pro 跑满精度 DeepSeek 4.1 Flash,破 300 TPS
TheZachMueller · x · 2026-09-11
开发者 @fraserpricee 展示在 4 张 RTX Pro 上以 300+ TPS 的速度运行满精度(full precision)DeepSeek 4.1 Flash,峰值系统内存不到 32GB,依赖一个定制的 vLLM fork 加上一块小 SSD。作者表示稍后会公布完整配置方案(recipe),目前先晒结果。这一本地部署方案说明消费级 GPU 集群也能以可用速度跑大模型满精度推理,细节待后续发布。
「Infra」频道最新
- 模型训完才算开始:10 份资源讲透推理部署层 — techNmak · 2026-09-11
- 趋境科技详解:用 Mooncake 把 KVCache 池化,托起日均万亿 Token 工厂 — 量子位 · 2026-09-11
- 网页 demo 近似复现 V4.1 flash 的 KV 快速预填充,跑在 Qwen3 上 — T_rex2700 · 2026-09-11
- OpenAI CFO:一年前买的算力如今市场价涨 3-5 倍,但仍然不够用 — rwang07 · 2026-09-11
- 讯飞星火X2.5全靠万卡国产910B训练,机器有效时长超97% — 机器之心 · 2026-09-11
- REVA 挖掘 LLM 历史注意力构建可复用证据视图,RAG 压缩开销降 5-15 倍 — _reachsumit · 2026-09-11