多卡满载部署 DeepSeek V4,Prompt 处理速度仅 600 t/s

fragment_me · reddit · 2026-08-02

开发者使用 5 张消费级显卡(2x 3080, 2x 3090, 5090)全显存加载 DeepSeek V4 的 IQ3XXS 量化版本,但发现 Prompt 处理(PP)速度仅约 600 t/s,难以作为日常模型使用。

作者已排除显存溢出或软件版本过旧的问题,正在尝试 Profiling,并在社区求助其他开发者的多卡 PP 性能基准数据。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →