RX 7600 XT 16GB 本地跑 30B 模型实测:结合投机解码达 20 t/s
DanC403 · reddit · 2026-08-12
开发者分享了在入门级独显 AMD Radeon RX 7600 XT (16GB) 上本地运行 Muse Glimmer 30B 模型的实践经验。
- 硬件与环境:宿主机为 Ryzen 5 4600G + 96GB DDR4 内存,通过 QEMU/KVM 将 GPU 直通给 Debian Sid 虚拟机,并使用 ROCm 7.2 编译了 llama.cpp。
- 量化与加速:采用 UD-Q2-K-XL 量化方案,并配合 DFlash 投机解码(speculative decoding)提升吞吐。
- 性能表现:在 62k 上下文下,Prompt 处理速度约 308 t/s,生成速度达 20 t/s。
- 编码实测:向模型输入 8 个 JS 文件和 1 个 HTML 文件,首轮即成功输出可用代码,首次运行直接通过。
「Infra」频道最新
- 低显存跑 MiniMax H3 烧毁显卡?用户实测翻车警告 — ROBOTTTTT13 · 2026-08-12
- StarCloud 探索太空数据中心:将 AI 硬件送入轨道 — DavidLinthicum · 2026-08-12
- gakonst 为 nanocodex 添加机密计算支持,实现可验证的机密 AI — AccBalanced · 2026-08-12
- 阿里云 CUBE 5.0 模块化设计:100 天建成 AI 数据中心并降本 10% — rohanpaul_ai · 2026-08-12
- CoreWeave 获 26 亿美元信贷,押注英伟达 GPU 长期价值 — OnlineInference · 2026-08-12
- poolside 举办 Laguna 模型加速赛,社区将其推理速度提升 2.6 倍 — gajesh · 2026-08-12