3张MI50实测本地运行DeepSeek V4:速度达15 t/s
Kamal965 · reddit · 2026-08-02
开发者成功在 3 张 AMD MI50 显卡(96 GB VRAM)上,使用 UD-IQ2M 量化格式完整加载了 90.9 GB 的 DeepSeek V4-Flash-0731 模型。
性能表现:
- 文本生成:稳定在 15-16 t/s,即便输出长达 30K token 也未跌破 14 t/s。
- Prompt 处理:速度约 105-110 t/s。
能力测试:
作者使用一段复杂的 3D 魔方 Canvas 动画提示词进行了代码生成测试。尽管模型在常识上出现了一点小失误(混淆了显存带宽与 PCIe 4.0 带宽),但作者对能在本地跑起该模型并保留调用 API 的备选方案感到非常惊艳。
所属事件:DeepSeek-V4-Flash 本地部署实测:消费级显卡到 DGX Spark 全覆盖(22 条相关)→
「Infra」频道最新
- 传 Google TPU 需求激增,2028 年预计达 1500 万颗 — SumitGup · 2026-08-03
- 单 CPU 8GB 内存跑 2.78 万亿参数 Kimi K3 — Saboo_Shubham_ · 2026-08-03
- tinygrad 预告本地部署新品,暗示 Qwen3.6-27B 即将发布 — max_paperclips · 2026-08-03
- 单节点吞吐量达 952 tok/s,AMD MI355X 跑赢英伟达 B200 — adrianscottcom · 2026-08-03
- Qwen3.8-27B即将开源,17GB内存即可本地运行 — danielhanchen · 2026-08-03
- AirLLM突破显存瓶颈:4GB显存单卡跑70B大模型 — techNmak · 2026-08-03