DeepSeek本地部署:投机解码导致极速掉速的排查

Easy_Werewolf7903 · reddit · 2026-08-09

开发者在使用 llama-server 本地部署 DeepSeek-V4-Flash 模型时,遇到了严重的性能问题。在硬件配置为 RTX 4090 + RTX 6000 Pro(共120GB VRAM)的环境下,原本使用 MTP 草稿模型进行投机解码能获得 30-40 t/s 的速度。

然而,当他切换到 DSpark 草稿模型后,生成速度暴跌至 1-2 t/s。他排除了显存不足的原因(因为 MTP 同样无法完全放入显存),并附上了两套完整的启动配置参数,请求社区协助分析 DSpark 模型参数中可能存在的性能瓶颈。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →