2×RTX 3090 + 512GB DDR5 本地跑大模型,如何冲上 15 t/s?
levoniust · reddit · 2026-09-11
Reddit 用户求助本地 AI 硬件升级方案:手握 8×64GB DDR5-5600 UDIMM(共 512GB)、两套 Core Ultra 7 265K 平台和 2×RTX 3090(48GB VRAM)。他跑 DeepSeek-R1-0528 Q3 量化版仅约 2 token/s,希望在保留现有硬件的前提下达到至少 15 t/s 的大模型生成速度,询问 Threadripper/EPYC/Xeon 等平台是否可行及具体 CPU/主板建议,欢迎实测数据。
「Infra」频道最新
- Bartowski 发文解析 GGUF 量化新方案:按张量布局映射分配位宽 — bartowski1182 · 2026-09-11
- antirez 在 128GB M5 Max 上跑 DeepSeek v4.1 Flash,SSD 流式加载快得出乎意料 — antirez · 2026-09-11
- 分析称 OpenAI 仍有约 7 倍训练算力余量,开源差距只是暂未拉开 — soumitrashukla9 · 2026-09-11
- DeepSeek 发布 V4.1-Flash,同周曝 Nvidia 200 亿美元 Groq 交易遭 DOJ 审查 — eyishazyer · 2026-09-11
- Persimmon 训练细节:基于 NVIDIA 550B Nemotron,数千块 Blackwell GPU — niloofar_mire · 2026-09-11
- NVIDIA 详解 EPD 分离架构:多模态推理首字延迟最高提速 5 倍 — NVIDIAAI · 2026-09-11