4×AMD V620 跑 DeepSeek-V4-Flash:300K 上下文,生成 21 tok/s

Thin_Pollution8843 · reddit · 2026-08-15

用户用 4 块 AMD Radeon Pro V620(共 128GB VRAM)运行 DeepSeek-V4-Flash-0731 的 IQ3XXS 量化版,配合 DSpark 投机解码。32K prompt 摄入速度 276 tok/s,短 prompt 摄入 379 tok/s,连续生成 21 tok/s,接受生成 30.6 tok/s。但 q3xxs 量化导致模型“变傻”,且 VRAM 不足无法放置 drafter。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →