RDNA4 本地推理提速:双 R9700 跑 Qwen3.8 Flash 达 100 tok/s
Public_Umpire_1099 · reddit · 2026-09-14
开发者发布 R9V 项目更新:在两块 R9700 + 128GB 内存的配置上,用 IQ4XS 量化跑 Qwen3.8 Flash Next,文本生成速度达约 100 tok/s;新增 Q4KXL 支持(约 50 tok/s)。
主要修复与改进:
- 通过 n-gram SSD streaming 修复崩溃问题,改善诊断信息,支持固定图像
- 作者进行了约 12 小时压力测试未发现不稳定
- Q4KXL 量化仍需继续调优
作者同时在做推理引擎和一个历时 6 个月的 deep research/建站应用,推送上线后会回归本项目。他还在 Launch80 Discord 分享配置,称社区里其他量化方案已有更好成绩,这套模型不完全驻留显存的配置正接近性能天花板。
「Infra」频道最新
- Perplexity 推出 Hybrid Compute:任务在云端与 Mac 本地间分流 — Aiden_Tech_Ai · 2026-09-14
- 仅保留4个首token+64token窗口,免训练匹敌线性注意力模型 — burny_tech · 2026-09-14
- 曝 Anthropic 与 RUM 集团签 137 亿美元 6 年算力大单 — rohanpaul_ai · 2026-09-14
- 全程 AI 写 OpenSCAD,3D 打印双 12 寸风扇救活 Thor 开发套件散热 — catplusplusok · 2026-09-14
- Hot Chips 记忆墙数据:算力两年翻 3 倍,HBM 带宽不到 2 倍 — Summit-Star001 · 2026-09-14
- WSJ 数据:数据中心挤占施工,净建设量反而下降 — GregCook2011 · 2026-09-14