个人开发者单卡 4090 从零预训练 565M 混合架构模型并开源
BLUECOW009 · x · 2026-10-09
开发者 alby13 在一张 RTX 4090 上从零完成了 LibraMind Mini(565M 参数)的全流程训练:Muon 优化器贯穿预训练、SFT、DPO 与带规则校验的 RL 五个阶段。
- 架构:18 层 Gated DeltaNet + 6 层 Gated Attention(DDDA × 6)的循环-注意力混合,24 层、宽度 1024,采用 Block Attention Residuals(BAR)残差拓扑
- 体量与速度:bf16 下仅约 1.1 GB,CUDA graphs 下推理超 1000 tok/s
- 定位:边缘设备角色扮演、游戏 NPC、语法掩码 JSON 结构化输出
- 开源:Apache 2.0,权重、推理代码与技术博客全部放出
作者非常坦诚:这个家用实验室训出的模型会幻觉、算术有误、未经安全训练,不能替代前沿模型,发布目的是展示现代架构设计的可能性;3B+ 规模对个人爱好者在经济上尚不可行。
「模型」频道最新
- Emad Mostaque:OpenAI 解 Navier-Stokes 花掉千万美元算力 — rohanpaul_ai · 2026-10-09
- 马斯克站台 Grok Bot:可调用 Opus 5.5、全量访问 X 数据 — elonmusk · 2026-10-09
- 开发者吐槽 Opus 5.5 不打招呼就塞进一堆小修复 — rickasaurus · 2026-10-09
- Mistral 高管澄清:FrontierCode 由 Cognition 私有评测,样本不外泄 — b_roziere · 2026-10-09
- Google 把决策模型塞进 Chrome,实测与 Gemini Nano、Decisions API 对比 — gaganghotra_ · 2026-10-09
- 用户随手录 60 秒屏幕,Grok Bot 竟自动剪出像样的教程视频 — elonmusk · 2026-10-09