5090 混搭 Intel Arc B70 跑本地模型:带宽减半换大上下文值不值

indiealexh · reddit · 2026-10-01

一位拥有 RTX 5090 的用户低价购入 Intel Arc B70,想利用其显存扩展本地 LLM 的上下文长度。他平时用 Qwen3 27B Q4KXL 做本地编码辅助,实测发现把模型拆分到 5090 + B70 双卡模式后,为获得完整上下文,吞吐量减半——原因是 B70 的显存带宽远低于 5090。他在帖中求助:是应该用 B70 单独跑小模型来分流任务,还是接受降速换取更大上下文,尤其希望有类似异构 GPU 组合经验的人分享。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →