双卡 Strix Halo 跨节点跑 DeepSeek V4 Flash 遭遇崩溃
WallabyFirm1159 · reddit · 2026-08-03
开发者尝试在两套通过 Mellanox ConnectX-3 网卡进行 RDMA 互联的 Strix Halo 系统上,使用 llama.cpp (ROCm) 跨节点运行 DeepSeek V4 Flash 模型。
尽管其他模型在此架构下均能正常运行,但该模型在处理提示词达到 4096 长度时会持续崩溃并掉线丢出内存。作者尝试使用 Claude Code 排查未果,向社区寻求多节点部署的排查经验。
「Infra」频道最新
- 从3D游戏到AI算力霸主:英伟达GPU发家史回顾 — TinfoilTricorn · 2026-08-03
- 算力资源消耗引争议:AI耗水真比农业和高尔夫球场多吗? — joshwhiton · 2026-08-03
- AI芯片创企 OLIX 获 3.12 亿美元 B 轮融资,估值 33 亿美元 — matthewclifford · 2026-08-03
- Mac 用户本地跑模型利器:llama-macos 一键部署服务与 WebUI — mervenoyann · 2026-08-03
- Raylight 支持双卡并行跑 MiniMax H3,生成时间直接砍半 — Altruistic_Heat_9531 · 2026-08-03
- 解密:AI 厂商如何实现视频模型 10 倍以上的推理加速? — haremlifegame · 2026-08-03