SOMA caps gradient variance for zero-order optimization, hitting SOTA on pretraining

StanfordAILab · x · 2026-10-01

François Chaubard's team unveiled SOMA (Sharded Optimization Mixture of Assemblies), a new architecture designed for zero-order (ZO) optimization that achieves SOTA for ZO methods on pretraining at controlled compute and parameter counts.

Original post →

More from Research

Research channel →