Qwen 3.5 9B 联手 DFlash 实测:R9700 上 75 tok/s 推理详解
karmakaze1 · reddit · 2026-08-20
Reddit 用户分享了在 R9 7900 上实现 Qwen 3.5 9B 模型 75 tokens/sec 推理速度的完整实践方案。该方案结合了微调模型 DavidAU/Qwen3.5-9B-The-Defiant-Fable... 与 DFlash 草稿模型加速技术,使用 Q80 量化并开启 64K 上下文。
核心步骤包括:
- 准备 Tokenizer:下载官方 Qwen BPE 文件到 DFlash 源目录。
- 转换模型:使用 converthftogguf.py 将草稿模型转换为 GGUF 格式。
- 配置服务:修改 INI 配置,移除过时参数,使用 model-draft 和 spec-draft-n-max 优化 Speculative Decoding。
- 启动运行:提供了 CLI 启动命令示例。
该方案通过草稿模型显著提升了推理生成速度。
「编程与Agent」频道最新
- 开发者用 React Native 和 WebGPU 复刻经典 iBeer 应用 — JoshuaJBouw · 2026-08-20
- Together AI 发布 Hallmark:拒绝 AI 味的设计 Skill — dotey · 2026-08-20
- Google 工程师拆解 Agent:只是循环里的 LLM 与现实落差 — bigdata · 2026-08-20
- OpenAI 自动化 12 项浏览器任务:从结账到表单填写 — gdb · 2026-08-20
- Instinct、Grok Bots 与 ChatGPT Work 深度对比评测 — illscience · 2026-08-20
- OpenCLIP 新增 MaMMUT 支持:修复 pooling 并推出 MaMMUT2 — wightmanr · 2026-08-20