Rust+Vulkan 训练后端两周新进展:14 种架构通过奇偶校验,LoRA 全流程可用

PhysicsDisastrous462 · reddit · 2026-09-30

一位独立开发者更新了自己的原生 Rust + Vulkan Transformer 训练后端进展。自两周前发布以来,通过严格校验门槛的架构从 7 种增加到 14 种,覆盖 Falcon H1/H1R(并行 GQA/RoPE 注意力+每层 Mamba2)、DeepSeek V4、Phi-4 Multimodal、Kimi K2.5/K3、GPT-OSS、SmolLM3、Qwen 系列、Mistral 4、MiniMax M3、Gemma 3/4 等。

校验方法非常严格:以钉死版本的 Hugging Face Transformers 源码为 oracle,对比前向 logits、梯度与两次完整 AdamW 步骤,逐一检查每个命名参数,绝对误差上限 2e-7,实测最差 1.19e-7、最好 2.6e-8。所有本地 Vulkan 验证都在 ASUS ROG Ally Z1 Extreme 掌机的 AMD RDNA 3 核显上完成。

更大的进展是 PEFT 真正可用:LoRA 微调支持与 HF 生态互通的 adapter 导出;modulestosave 完整支持可训练替换 Linear、RMSNorm/LayerNorm、lmhead 和输入嵌入,含多 adapter 切换与隔离(测试了 adapter 泄漏);支持 bit 级精确恢复训练;merge/unmerge、多 adapter 加载;参数预算 flag 自动选最大可行 LoRA rank。横跨 20 个模型族的 32 个架构面通过 LoRA、saved modules、adapter 切换三阶段 PEFT 校验,冻结基座漂移恰为 0。作者还提到期间因新冠和耳部感染住院耽误了几天,但坚持完成了大部分工作。

所属事件:独立开发者 Rust+Vulkan 训练后端两周进展:14 种架构通过校验(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →