4x3090跑DeepSeek 284B:优化后预填充飙至1906 tok/s
max_paperclips · x · 2026-08-05
开发者 @superalesha 分享了在 4 张 3090 显卡上运行 DeepSeek-V4-Flash 284B 模型(2-bit 量化版)的极限优化成果。
- 性能飞跃:经过对 CPU 与显卡之间瓶颈的定向排查与修复,模型的预填充速度从早上的 433 tok/s 暴增至 1906 tok/s(在 98K 上下文深度下达到 4.3 倍提升)。
- 解码稳定:解码速度保持在 37-40 tok/s 未受影响。
- 零权重修改:整个优化过程未改变模型的任何原始权重,仅用一天时间打通了底层硬件通信墙。
「Infra」频道最新
- 删掉90%权重仍能用:MIT宋寒与AI模型量化简史 — JafarNajafov · 2026-08-05
- 单台 RTX PRO 6000 实测:Qwen3.6 35B NVFP4 推理破 3000 tokens/s — max_paperclips · 2026-08-05
- Cloudflare CEO:AI智能体流量已超人类,未来将达千倍 — 0xSammy · 2026-08-05
- RTX 3060 跑 Minimax H3 生成 15 秒需 1.5 小时,开发者求助本地优化 — SMPTHEHEDGEHOG · 2026-08-05
- RTX 5060Ti 16GB 能否跑动 Qwen 27B?玩家探讨本地部署硬件选择 — Yanzihko · 2026-08-05
- AI 盈利助推美股创新高,Palantir 营收大涨 93% — nordicinst · 2026-08-05