多卡跑 llama.cpp 张量切分崩溃?微调批大小即可解决
_TheWolfOfWalmart_ · reddit · 2026-08-08
针对多张 gfx1030 架构显卡(如 V620)在 llama.cpp 中使用张量切分时容易崩溃的问题,开发者分享了一个有效的解决方案。
- 问题原因:默认微批次大小为 512 或更高时,会触发 GPU 显存损坏的 Bug 导致崩溃。
- 解决方法:将 -ub 参数设置为 384,并将 -b 参数设置为该值的倍数(至少乘以参与切分的 GPU 数量)。
- 性能实测:在 2 张 V620 显卡上测试 Qwen 模型,27B Q80 模型可达 40-50+ t/s 生成速度;35B-A3B Q80 模型可达 80-110+ t/s。
「Infra」频道最新
- ML工程开源书大更:新增多款GPU关键数据横向对比 — StasBekman · 2026-08-08
- 推理服务性能优化实战:一张图看懂 P50 与 P90 延迟变化 — DanielLockyer · 2026-08-08
- 马斯克合建全球最大建筑:百亿美金打造 AI 芯片超级工厂 — coinfanking · 2026-08-08
- llama.cpp RPC 提速 PR:300GB 模型加载缩至 1 分半 — Chuyito · 2026-08-08
- 反直觉实测:MiniMax H3全量大模型比量化版更快且物理一致性更好 — Wise_Revolution385 · 2026-08-08
- 英伟达拟斥资 30 亿美元,投资黑石支持的电力公司 — pstAsiatech · 2026-08-08