自建物理实验室数据练出万亿参数模型,达内存效率SOTA
vwxyzjn · x · 2026-09-16
zijiey 透露其团队用自家物理实验室产生的数据训练了一个万亿参数模型,并称这句话背后藏着大量训练基础设施工作:长科学轨迹对内存与并行性是极大考验,团队最终在内存效率和长上下文训练性能上达到 SOTA,从而能更快尝试更多想法,相关成果已进入 Neon 项目。Bahdanau 转发称赞其为「前沿级训练的 GOAT」,并透露团队正在招聘一位新同事,职位 posting 即将发布,可先私信联系。
「Infra」频道最新
- SentencePiece Lite 发布:50KB 二进制,tokenization 快 20-30 倍 — heiga_zen · 2026-09-16
- 华为内部万字备忘录泄露:押注昇腾950替代英伟达,不做基础模型 — pstAsiatech · 2026-09-16
- Qwen 27B 与 DeepSeek v4 Flash 同机异构运行,展示 GPU+统一内存方案 — samsja19 · 2026-09-16
- JPMorgan 预测 2028 年 GPU/ASIC 出货超 2500 万,ASIC 主导增长 — bookwormengr · 2026-09-16
- iamtrask:终局不是单个 AGI,而是人人运行小型 LLM 的信任网络 — iamtrask · 2026-09-16
- Program-as-Weights:0.6B 模型跑赢 32B 直接提示,内存仅 1/50 — yuntiandeng · 2026-09-16