双R9700跑Qwen3.8 27B达280 tok/s,MXFP4超越FP8逼近硬件极限
whodoneit1 · reddit · 2026-09-02
- 作者持续优化双 AMD Radeon R9700 本地推理,社区已从最初 5 人增长到 1200 名开发者协作
- 在 DeadCode 的 radiance 镜像基础上自研 MXFP4 支持,采用 W4A8 内核,性能先追平 FP8 后大幅反超,目前已逼近显卡硬件极限
- BetterBench 解码实测:JSON 任务 280 tok/s、数学 254、代码 226、聊天 148;预填充在 94k token 提示下仍保持 3831 tok/s
- KV cache 容量达 94 万 token,完整镜像与仓库已开源(codeberg.org/ggz14/radiance-vllm-mxfp4)
「Infra」频道最新
- GLM-5.3 模型推出 GGUF 量化版,适配端侧部署 — unsloth · 2026-09-02
- Asus AI PC 价格暴涨 50%,市场预测 DGX Spark 将涨价 — mountainyoo · 2026-09-02
- 用户反馈:GPT 基础设施数月未宕机,资源限制管理出色 — natesiggard · 2026-09-02
- 微软两篇 LLM 数据库相关论文获 VLDB 2026 奖项 — jm_alexia · 2026-09-02
- 本地 RAG 应否常驻空闲算力?架构权衡讨论 — Cautious_Bit_8521 · 2026-09-02
- M1 Max 性能更强:Qwen 3.8 在 128k 上下文跑出 72 tok/s — EyalToledano · 2026-09-02