Rust+Vulkan 实现训练后端,覆盖 143 种 Transformer 架构
PhysicsDisastrous462 · reddit · 2026-09-17
开发者 necat101 发布开源项目 Hierarchos Native:用 Rust + Vulkan compute 从零实现的训练/推理后端,不依赖 CUDA 或 PyTorch,支持 143 种主流 Transformer 架构(含 HF 别名共 224 种 model-type 拼写)。
已实现的原生组件:
- 前向/反向传播、全模型训练、AdamW
- LoRA/PEFT 微调、混合精度、checkpoint 续训
- attention 与 KV-cache、dense 与 MoE、RMSNorm/LayerNorm、RoPE
- SafeTensors 交换格式,从 Rust 直接获取 HF 模型/分词器/数据集
- 原生生成推理路径与 CLI
覆盖架构:Llama、Qwen、Gemma、Mistral/Mixtral、DeepSeek、Phi、OLMo、Granite、Cohere、BERT 系、T5/BART 系等,并为新模型设计写了架构专属 Vulkan kernel,而非统一近似。
定位与局限:作者明确不宣称是 CUDA/PyTorch 替代品,只支持原生文本图,多模态 tower 不在范围内,性能与硬件兼容性仍待独立测试。开发测试在 AMD RDNA 3 上进行(包括 ROG Ally Z1 Extreme 掌机),暴露了高端 CUDA 生态下不易察觉的假设。
意义:Vulkan 跨 NVIDIA/AMD/Intel 及集成显卡可用,若此类原生训练栈成熟,ML 训练基础设施有机会摆脱单一厂商算力生态绑定。
所属事件:开发者用 Rust+Vulkan 实现训练后端覆盖 143 种架构(2 条相关)→
「Infra」频道最新
- 三年多来首次加息撞上AI算力军备竞赛,新云厂商资本成本承压 — nateliason · 2026-09-17
- 华为本周将发布昇腾 960 AI 芯片,对标替代英伟达 — Polymarket · 2026-09-17
- Rune Energy 融资 4000 万美元,离网太阳能 60 分钟部署 AI 数据中心 — rebeccakaden · 2026-09-17
- 双 RTX Pro 本地推理实测:解码 150 tok/s、预填充 10K tok/s — No_Run8812 · 2026-09-17
- GPU 价格仍在上涨,算力供不应求成行业共识 — firstadopter · 2026-09-17
- Guardian:十大 PFAS 厂商几乎全部扩产,为满足 AI 芯片与数据中心冷却需求 — jathansadowski · 2026-09-17