三卡本地跑 DeepSeek 的实测配置
Jaswanth04 · reddit · 2026-07-19
作者在一套老平台上本地运行 DeepSeek-V4-Flash Q8 量化版:3 张卡分别是两张 RTX 3090(24GB)和一张 RTX 5090(32GB),加上 128GB DDR4 内存与 Ryzen 3950X。
他给出了完整的 llama.cpp 启动参数,包括多 GPU layer split、tensor split、把 MOE 层移到 CPU、关闭 mmap、使用 262144 上下文等配置,并声称这种 override tensor 的放置方式能让显卡利用更均衡。
实测速度方面,prompt eval 约 37.9 tok/s,生成阶段约 9.07 tok/s。作者认为它在编码任务上的表现优于 Qwen 3.5 v2,并询问在不升级硬件的前提下还能如何提升 token 速度。
「Infra」频道最新
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11