Qwen 3.5 9B 联手 DFlash 实测:R9700 上 75 tok/s 推理详解

karmakaze1 · reddit · 2026-08-20

Reddit 用户分享了在 R9 7900 上实现 Qwen 3.5 9B 模型 75 tokens/sec 推理速度的完整实践方案。该方案结合了微调模型 DavidAU/Qwen3.5-9B-The-Defiant-Fable... 与 DFlash 草稿模型加速技术,使用 Q80 量化并开启 64K 上下文。

核心步骤包括:

该方案通过草稿模型显著提升了推理生成速度。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →