R9700 专用量化提速 5.8%
alphatrad · reddit · 2026-07-18
作者为三张 Radeon AI PRO R9700 调校了专用量化格式 Q80ROCMFPX,目标是在 gfx1201 上比通用 Q8 更快。
结果
- 模型体积比 upstream Q80 小 2.94%
- HumanEval:140/164,与原版打平
- 全模型解码:5.77%–5.87% 更快
- 等工作量测试:中位数 5.82% 更快,17/18 组配对胜出,p=0.000965
- 端到端 agent 总耗时:仅 2.21% 更快,未达到作者预设的 3% 阈值
约束
- 目前不能在 upstream llama.cpp、Ollama、LM Studio、vLLM 上直接跑
- 需要作者锁定的 ROCmFPX fork 和源码编译
- 这套调优主要对 gfx1201 / R9700 有效,对 NVIDIA 或其他 AMD 卡帮助有限
作者还给出了完整实验仓库,表示如果更多人复现并对比 stock Q8,会很有帮助。
「Infra」频道最新
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11