论文把 Transformer 组件建成随机几何框架,并做了五模型验证
Zhihua Liang · hf · 2026-07-21
用连续几何重写 Transformer
这篇预印本试图把 Transformer 的核心组件——RMSNorm、RoPE、Softmax Attention、FFN、Residual Stream、SGD 和 Weight Decay——统一到一个语义纤维丛上的积分-微分方程框架中。
核心主张
- 设定一个几何公理:token 序列是带有规范测度格点的离散一维流形。
- 将注意力解释为熵最优传输,更具体地说是 Schrödinger bridge。
- 将 SGD 视为违反详细平衡的 Itô 扩散。
实验结果
作者在 5 种架构 上做了六部分实验,覆盖 Qwen3、LLaMA-3.1、Gemma-3、GPT-2、Mistral,参数规模从 124M 到 8B。
他们声称观察到的实验现象与几何预测高度一致,包括:
- ε^{-1/2} 的 Lipschitz 标度校准,R² = 1.000
- Lie–Trotter 算子分裂扭转
- 对称消融导致的不稳定性
- RoPE 圆环上的 O(1/k) Poincaré recurrence 抑制
- 语境长度极限的热力学相变
- 非平衡稳态参数涡旋
结论
作者认为,用连续随机微分几何来分析 Transformer,能为大模型的稳定性边界、上下文上限与优化动力学提供一种可预测的描述语言。
「研究」频道最新
- ARISE 研究评测 45 个医疗 AI 工具,覆盖 1100 个会诊案例 — HealthcareAIGuy · 2026-07-21
- 异步 OPD 蒸馏在数学任务上提速约两倍 — _lewtun · 2026-07-21
- 一个预测建模教训:只看 R2 为什么会更糟 — mdancho84 · 2026-07-21
- Google DeepMind 分享 Project Genie 的创作者协作幕后 — alexanderchen · 2026-07-21
- Nat Lambert 反驳 RL 蒸馏直接用最强模型当老师 — natolambert · 2026-07-21
- 线程称 GPT-5.6 Sol 帮忙构造出 Jacobian 猜想反例工厂 — LucaAmb · 2026-07-21