硬核玩家魔改 ROCm 6.4.3 让 AMD MI50 恢复训练,还用 Vulkan 跑通
Savantskie1 · reddit · 2026-09-19
一位持有双卡 AMD MI50 32GB(共 64GB HBM2)的用户分享了在 AMD 官方放弃支持的 gfx906 上恢复深度学习工作负载的过程,并反驳了「Vulkan 上无法训练」的共识。
要点:
- AMD 在 ROCm 6.x 移除了 gfx906 支持,作者分析问题只在于预编译的 TensileLibrary 缺 gfx906 内核,硬件本身没问题。他手动补回内核文件、修补 ROCm 6.4.3,两张卡恢复识别,PyTorch 与 llama.cpp 可用
- vLLM 方面:ROCm 7.x 因 AMD bug #5653 失败,nlzy fork 被 flash-attn V1 依赖卡住,最终用一个预编译 flash-attn 的 Docker 镜像(ROCm 6.3.4 + PyTorch 2.11)实现单卡推理;双卡张量并行仅剩 PCIe 拓扑问题(两卡分属不同 root complex),等 PLX 交换芯片即可解决
- 最核心的是从零搭建 Vulkan 训练栈:作者称所有 AI 助手和论坛都说反向传播基础设施只存在于 ROCm/CUDA,而他在训练运行中用 Vulkan(llama.cpp 同款路径)跑训练,直接反驳了 ChatGPT 的「不可能」论断
- 文章带出对 AI 助手自信错误答案的批评:多个助手几个月来反复给出「不支持、请升级硬件」的统一错误结论
「Infra」频道最新
- AI 基建积压订单与实际营收差距空前,信贷风险被低估 — saranormous · 2026-09-19
- Seedance 2.5 上线 fal 美国托管基础设施 — jfischoff · 2026-09-19
- SpaceX CFO:本十年末每年部署 100 GW 轨道算力 — NicoVerderosa · 2026-09-19
- 12GB 显存跑通 YuE2 BF16:实测音质更好,附优化参数 — lazyspock · 2026-09-19
- 开源小型设备 C 编译器 SDCC 持续维护,支持多款 8/16 位 MCU — lioeters · 2026-09-19
- 开源引擎 Inco Splash 让 Qwen3.8-27B 在 M5 Max 跑出 144 tok/s — ResearchCrafty1804 · 2026-09-19