混合 4 张 AMD 显卡本地跑大模型,推理速度达 11 t/s
Hyungsun · reddit · 2026-08-02
一位开发者在 Reddit 分享了使用混合 AMD 显卡组合(1 张 7900 XTX 24GB + 3 张 MI60 32GB)配合 128GB DDR4 内存,本地运行 DeepSeek-V4-Flash-0731 量化版的实测数据。
- 硬件配置:双路 Xeon E5-2650 v4 CPU,由于一张 MI60 损坏,被迫采用消费级与数据中心级混合的异构显卡方案。
- 推理性能:在未完全优化的 llama.cpp(ROCm 后端)下,Prompt 处理速度在 140 t/s 左右(64k 上下文时降至 85 t/s),生成速度稳定在约 11.9 t/s。
所属事件:DeepSeek-V4-Flash 本地部署实测:消费级显卡到 DGX Spark 全覆盖(22 条相关)→
「Infra」频道最新
- 传 Google TPU 需求激增,2028 年预计达 1500 万颗 — SumitGup · 2026-08-03
- 单 CPU 8GB 内存跑 2.78 万亿参数 Kimi K3 — Saboo_Shubham_ · 2026-08-03
- tinygrad 预告本地部署新品,暗示 Qwen3.6-27B 即将发布 — max_paperclips · 2026-08-03
- 单节点吞吐量达 952 tok/s,AMD MI355X 跑赢英伟达 B200 — adrianscottcom · 2026-08-03
- Qwen3.8-27B即将开源,17GB内存即可本地运行 — danielhanchen · 2026-08-03
- AirLLM突破显存瓶颈:4GB显存单卡跑70B大模型 — techNmak · 2026-08-03