多卡满载部署 DeepSeek V4,Prompt 处理速度仅 600 t/s
fragment_me · reddit · 2026-08-02
开发者使用 5 张消费级显卡(2x 3080, 2x 3090, 5090)全显存加载 DeepSeek V4 的 IQ3XXS 量化版本,但发现 Prompt 处理(PP)速度仅约 600 t/s,难以作为日常模型使用。
作者已排除显存溢出或软件版本过旧的问题,正在尝试 Profiling,并在社区求助其他开发者的多卡 PP 性能基准数据。
「Infra」频道最新
- 算力之后的新瓶颈:电力短缺正成为 AI 竞赛的决定因素 — ingliguori · 2026-08-02
- AMD MI355X 推理性能跑赢 B200,社区优化立功 — marksaroufim · 2026-08-02
- Together AI 月处理 Token 量超 400 万亿,实现万倍增长 — togethercompute · 2026-08-02
- DeepSeek V4 Flash 3bit 量化版 3x3090 实测:119GB 占用 — consultkitapp · 2026-08-02
- 12GB 显存已够用?本地跑大模型的显卡升级抉择 — rettdit · 2026-08-02
- 曝 SpaceX 拟建 4GW 算力集群,规模匹敌全美今年新增电力 — BenBajarin · 2026-08-02