2x RTX 2060 跑 Qwen3.8 27B 达 45 tok/s,值得换 AMD 6800 双卡吗
BarberIcy366 · reddit · 2026-09-09
Reddit 用户晒出 llama.cpp 本地部署实测:两块 RTX 2060 12GB(共 24GB 显存)跑 Qwen3.8 27B IQ4XS、131k 上下文,约 45 tok/s。他看中 RX 6800 + 6800 XT(共 32GB)的二手价,纠结于更高带宽在 llama.cpp 混合 AMD 多卡下能否兑现,并询问 6800 系 ROCm/Vulkan 支持现状与同配置用户的实际 tok/s,供后来者参考这套性价比方案的可行性。
「Infra」频道最新
- Proteus 为 Qwen3 122B 定制 GPU 内核,比 vLLM 最快实现快 5.2 倍 — matei_zaharia · 2026-09-09
- Google Cloud 八月 AI 基础设施盘点:gVisor 进 Ray 集群、Filestore 上 Colossus — dl_weekly · 2026-09-09
- 可证明隐私的远程推理服务兴起:密码学保证提示词对服务商不可读 — corbtt · 2026-09-09
- 3000亿输出token耗资数千万美元,Ethan Mollick:算力再多也不够用 — eldonredwards · 2026-09-09
- 传 Google 或取代 Nvidia 成台积电最大客户,年初传闻正逐渐应验 — zephyr_z9 · 2026-09-09
- Tahuna 开源:一条命令在远程 GPU 上跑 ML 训练全流程 — Monaim101 · 2026-09-09