SSOG Challenges SDPA in ViTs, Offering Faster Convergence and Near-Linear Scaling

serrjoa · x · 2026-08-17

Argues that Scaled Dot-Product Attention (SDPA) is suboptimal for Vision Transformers (ViTs). Introduces SSOG (Separable Sum Of Gaussians), which achieves faster convergence, better performance, and near-linear scaling capabilities.

Related event: SSOG Attention Challenges SDPA with Subquadratic Complexity in Vision Transformers(2 posts)→

Original post →

More from Research

Research channel →