双 7900 XTX 消费机跑出 82 tok/s:RDNA3 优化版 llama.cpp 分支
deathcom65 · reddit · 2026-09-18
Reddit 用户分享一个社区优化的 llama.cpp 分支(llama.cpp-RDNA3-7900xtx-opt),专门针对双 AMD 7900 XTX 消费级显卡配置。
- 运行 Qwen 3.8 Q8 模型,decode 速度从原生 llama.cpp + Vulkan 的约 28 tokens/s 提升到 82 tokens/s(60k context 加载下),提升近 3 倍。
- 作者称用 AI 助手在 Linux 上完成了整套环境搭建,一次跑通。
- 分享目的是希望更多人接力优化 RDNA3 本地推理。
「Infra」频道最新
- 博主预测:18 个月内 16GB 机器可流畅跑高质量本地模型 — julianharris · 2026-09-18
- vLLM 为 2.8T 参数 Kimi K3 训练 DSpark,推理提速至 435 tok/s — AccBalanced · 2026-09-18
- 团队 Key 各自为政,Reddit 求企业 LLM 网关选型经验 — almost1it · 2026-09-18
- NVIDIA DGX Station GB300 现场演示:本地跑出每秒数千 token — TheZachMueller · 2026-09-18
- OpenAI 高管:GPU 每瓦 7-40 IQ 点,已超人类的 5 — GregCook2011 · 2026-09-18
- 烧结稀土磁体:中国精炼 91%、制造 94%,AI 硬件供应链真正的卡点 — demian_ai · 2026-09-18