R9V:RDNA4 定制内核跑 Qwen3.8 吞吐量提升 30 倍实测
Public_Umpire_1099 · reddit · 2026-08-31
作者发布了针对 AMD RDNA4 (R9700s) 架构高度定制的推理内核 R9V,并将其集成到 vLLM-Radiance 中,显著提升了 Qwen3.8-Flash-Next 和 Muse Glimmer 30B 的性能。
关键数据 (双 R9700, 128GB RAM):
- Qwen3.8 Flash Next: Prefill (PP8192) 达到 1510 tok/s (提升约 30x),TG256 达到 78 tok/s (提升约 3x)。
- Muse Glimmer 30B: 各项指标均优于 llama.cpp (ROCm/Vulkan)。
技术细节:
- 深度利用了 RDNA4 的 Wave32 设计、DPP 操作和整数点积指令。
- 优化了 MTP (Speculative Decoding),通过复用 token 路由实现 27% 的带宽优化。
- 优化了 Prefill 阶段,按专家分组 token (group size=16)。
- 针对密集模型,实现了多向量权重的有效复用和 HyperConnection 的融合。
「Infra」频道最新
- 独家:SK海力士拟将HBM4E基础裸片部分外包英特尔代工 — BenBajarin · 2026-08-31
- 月费 200 美元却让 OpenAI 月亏 1.4 万,真事改编 — BuildersReadOnAI · 2026-08-31
- 实战:测量 Windows 应用对 Agent 暴露的控件树 — Frequent-Ad-836 · 2026-08-31
- Rayrun 推出 sPTC 技术,AI 响应速度提升 20% — lucgagan · 2026-08-31
- 网友想把 1.25bit 量化方案搬到 Qwen3.8-Flash-Next — TemperatureOk3561 · 2026-08-31
- 三星 HBM4 领跑,SK 海力士/美光遇阻 — AccBalanced · 2026-08-31