5090 混搭 Intel Arc B70 跑本地模型:带宽减半换大上下文值不值
indiealexh · reddit · 2026-10-01
一位拥有 RTX 5090 的用户低价购入 Intel Arc B70,想利用其显存扩展本地 LLM 的上下文长度。他平时用 Qwen3 27B Q4KXL 做本地编码辅助,实测发现把模型拆分到 5090 + B70 双卡模式后,为获得完整上下文,吞吐量减半——原因是 B70 的显存带宽远低于 5090。他在帖中求助:是应该用 B70 单独跑小模型来分流任务,还是接受降速换取更大上下文,尤其希望有类似异构 GPU 组合经验的人分享。
「Infra」频道最新
- M5 Ultra 256GB 实测:Qwen3.8 200K 预填充快 Laguna 10 倍 — nonlinearsystems · 2026-10-01
- 微软 Foundry 系列开篇:模型越强,内容抽取层越不可省 — adnan_hashmi · 2026-10-01
- 美光季度营收近翻四倍至542亿美元,大超市场预期 — Polymarket · 2026-10-01
- 坐拥 TPU 却算力饥荒:Google 内部各团队抢算力乱象盘点 — zacharynado · 2026-10-01
- 美光:2026 年 12 月起提高股东回报,逐步返还全部超额现金 — firstadopter · 2026-10-01
- 前 OpenAI 政策副总裁:算力已分化成三个等级鸿沟持续拉大 — Miles_Brundage · 2026-10-01