SOMA 架构为零阶优化封顶梯度方差,预训练达 SOTA
StanfordAILab · x · 2026-10-01
François Chaubard 团队发布针对零阶(ZO)优化的新架构 SOMA(Sharded Optimization Mixture of Assemblies),在控制算力与参数量的条件下于预训练任务上取得 ZO 方法 SOTA。
- 问题:ZO 方法随模型增大难以改善 loss,因为相对梯度方差随被扰动参数数量线性增长,阻碍大模型训练。
- 思路转变:以往工作都在优化器上创新,却沿用为反向传播设计的架构;SOMA 从架构层面为 ZO 量身设计,随模型扩大封顶梯度方差。
- 做法:将模型切分为大量微小专家,在每个独立(解耦)的 GPU 上独立训练,训练期间不通信梯度、激活或优化器状态。
- 灵感:借鉴丘脑与皮层柱结构,每个专家专门负责训练数据的一个子集。
「研究」频道最新
- 芝浦工大 Ozaki Scheme II 入选 CUDA 13.4,用低精度算力跑高精度计算 — udmrzn · 2026-10-01
- 函数梯度下降胜过神经网络一个量级,新论文解决近似收敛难题 — burkov · 2026-10-01
- 论文发现 LLM「mode-hopping」:40B token 内准确率 81%→0%→81.7% — jiaxinwen22 · 2026-10-01
- 注意力头间互通的 IHA 被 NeurIPS 接收,RULER 检索提升 10-20% — _arohan_ · 2026-10-01
- MICCAI 2026 上 BrainWorks 工作坊聚焦 AI 与脑疾病数据规模化定律 — PTenigma · 2026-10-01
- LibraryDesignBench:让 AI 设计库、再用它写代码,考察 Agent 能否用好库 — a1zhang · 2026-10-01