AMD R9700 单卡跑 Qwen3.8-27B 达 227 tok/s,无损加速新纪录
samsja19 · x · 2026-08-27
Lucebox 引擎宣布在单张 AMD Radeon AI PRO R9700 (32GB, RDNA4) 上运行 Qwen3.8-27B,配合 z-lab 的 DFlash2 块扩散草稿模型,实现代码生成最高 227 tok/s,HumanEval 平均 208 tok/s,数学 133 tok/s。使用 Unsloth 的 UD-IQ4XS 量化模型,与 Q80 参考相比,KL 散度 0.018,top-1 一致率 94%,且无损(贪心验证只提交模型自身会生成的 token)。
「Infra」频道最新
- OpenAI 展示 AI 辅助设计的首代芯片,大幅加速研发流程 — AccBalanced · 2026-08-27
- Stable Diffusion 节点实现真正免费的模型与缓存 — JustLookingForNothin · 2026-08-27
- Redis 作者宣布全力开发免费本地推理引擎 — antirez · 2026-08-27
- Gemma 4 31B 在 Groq 3 跑出 3431 tok/s — GlennCameronjr · 2026-08-27
- Nativ 助手首发支持 GLM-5.3 本地跑 505 tok/s — lllucas · 2026-08-27
- DeepInfra 首发支持 GLM-5.3 与 320B 多模态 — gharik · 2026-08-27