Rust+Vulkan 训练后端两周新进展:14 种架构通过奇偶校验,LoRA 全流程可用
PhysicsDisastrous462 · reddit · 2026-09-30
一位独立开发者更新了自己的原生 Rust + Vulkan Transformer 训练后端进展。自两周前发布以来,通过严格校验门槛的架构从 7 种增加到 14 种,覆盖 Falcon H1/H1R(并行 GQA/RoPE 注意力+每层 Mamba2)、DeepSeek V4、Phi-4 Multimodal、Kimi K2.5/K3、GPT-OSS、SmolLM3、Qwen 系列、Mistral 4、MiniMax M3、Gemma 3/4 等。
校验方法非常严格:以钉死版本的 Hugging Face Transformers 源码为 oracle,对比前向 logits、梯度与两次完整 AdamW 步骤,逐一检查每个命名参数,绝对误差上限 2e-7,实测最差 1.19e-7、最好 2.6e-8。所有本地 Vulkan 验证都在 ASUS ROG Ally Z1 Extreme 掌机的 AMD RDNA 3 核显上完成。
更大的进展是 PEFT 真正可用:LoRA 微调支持与 HF 生态互通的 adapter 导出;modulestosave 完整支持可训练替换 Linear、RMSNorm/LayerNorm、lmhead 和输入嵌入,含多 adapter 切换与隔离(测试了 adapter 泄漏);支持 bit 级精确恢复训练;merge/unmerge、多 adapter 加载;参数预算 flag 自动选最大可行 LoRA rank。横跨 20 个模型族的 32 个架构面通过 LoRA、saved modules、adapter 切换三阶段 PEFT 校验,冻结基座漂移恰为 0。作者还提到期间因新冠和耳部感染住院耽误了几天,但坚持完成了大部分工作。
所属事件:独立开发者 Rust+Vulkan 训练后端两周进展:14 种架构通过校验(2 条相关)→
「Infra」频道最新
- 堆 GPU 和 token 能加速 AI 自我迭代吗? — menhguin · 2026-09-30
- 9B 开源模型换入云端 Agent 系统,准确率从 96% 跌至 62.3% — TheZachMueller · 2026-09-30
- 黄仁勋:AI 数据中心年增 10-20GW,创造约百万岗位 — victor_explore · 2026-09-30
- 首届 SGLang Summit 定档 11 月:英特尔 CEO 与 Karpathy 级阵容齐聚 — BanghuaZ · 2026-09-30
- OpenAI 自研芯片负责人 Richard Ho 访谈上线 — bookwormengr · 2026-09-30
- Tenstorrent 开放生物模型训练:Blackhole Galaxy 性能接近 DGX H200,成本仅四分之一 — MoAlQuraishi · 2026-09-30