单张 3090 极限跑 DeepSeek V4:每秒生成 4 tokens

Altruistic_Heat_9531 · reddit · 2026-08-01

一位开发者在未优化的单张 RTX 3090 系统上成功运行了 DeepSeek V4 模型。在搭配老旧 CPU、机械硬盘以及 Unsloth UD Q2 KXL 量化方案的情况下,实现了 4.02 tokens/s 的生成速度和 40 tokens/s 的提示词处理速度。这展示了在极受限的硬件环境下部署大模型的真实数据。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →