Rust+Vulkan 原生训练后端,支持 143 种 Transformer 架构
PhysicsDisastrous462 · reddit · 2026-09-17
开发者发布 Hierarchos-Native 项目,用 Rust + Vulkan 实现了一套原生训练/推理后端,覆盖 143 种标准 Transformer 架构,加上 Hugging Face modeltype 别名后注册表达 224 种模型类型拼写,全程不依赖 CUDA 或 PyTorch。
后端已实现的能力包括:
- 前向/反向传播、全模型训练、AdamW 优化器
- LoRA/PEFT 风格微调、embedding 与 LM head
- attention 与 KV-cache 路径、稠密与 MoE 架构
- RMSNorm/LayerNorm、RoPE 与位置操作、常见激活函数
- 交叉熵与梯度计算、混合精度基础设施、断点续训
- SafeTensors 模型交换、从 Rust 获取 HF 模型/分词器/数据集、原生生成推理
架构注册表覆盖 Llama、Qwen、Gemma、Mistral/Mixtral、DeepSeek、Phi、OLMo、Granite、Cohere、BERT 系、T5/BART 系等,并针对新模型设计了专用 Vulkan kernel,而非用单一通用近似硬套。
作者明确声明:目前不宣称这是 CUDA/PyTorch 的替代品,支持某模型类型也不代表其所有配置和多模态组件都已验证——注册表描述的是原生文本图实现,多模态包中的视觉/音频塔不在原生文本后端内,真实兼容性仍需更广泛的模型与硬件测试。
其价值在于方向:Vulkan 横跨 NVIDIA、AMD、Intel 及大量集显/移动硬件,若原生训练栈成熟,有望让 ML 训练基础设施不再绑定单一厂商生态。作者在 AMD RDNA 3 硬件(含 ROG Ally Z1 Extreme)上开发测试,便于暴露只围绕高端 CUDA 系统开发时被忽略的假设。仓库含 Rust 源码、Vulkan compute shader/SPIR-V、CLI、运行时、架构文档与验证工具。
所属事件:开发者用 Rust+Vulkan 实现训练后端覆盖 143 种架构(2 条相关)→
「Infra」频道最新
- Seroter 每日阅读精选:agent 要讲 why、72 次试验检验 skills 价值 — rseroter · 2026-09-17
- 预训练算力占比 67% 将跌至 7%,后训练与 RL 成新重心 — FinanceYF5 · 2026-09-17
- 256GB 八通道 Epyc 本地推理机,加一张 3090 划算吗 — u_Leon · 2026-09-17
- 三年多来首次加息撞上AI算力军备竞赛,新云厂商资本成本承压 — nateliason · 2026-09-17
- 华为本周将发布昇腾 960 AI 芯片,对标替代英伟达 — Polymarket · 2026-09-17
- Rune Energy 融资 4000 万美元,离网太阳能 60 分钟部署 AI 数据中心 — rebeccakaden · 2026-09-17