双卡 AMD v620 跑开源大模型实测:张量并行大幅提升处理速度

Thin_Pollution8843 · reddit · 2026-08-11

开发者分享了在两块老旧 AMD v620 GPU 上运行开源多模态模型 Muse-Glimmer-30B 的实测数据与配置代码。通过开启张量并行,双卡协同不仅成功运行了模型,还在 Prompt 处理速度上实现了近乎翻倍的提升。帖子附带了单卡 Q6、双卡 Q6 及双卡 Q8 模式的详细 llama-server 启动参数,并对比了不同上下文长度下的生成与处理速度。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →