注意力矩阵因式分解重构梯度流,破除信息指数瓶颈
burny_tech · x · 2026-10-01
- 作者论证注意力矩阵因式分解(权重绑定 S=WWᵀ)不只是参数化技巧,而是从根本上改变了梯度流动方式。
- 核心结论:权重绑定消除了一个「信息指数瓶颈」(information-exponent bottleneck),未分解模型会被该瓶颈无限期卡住,而分解后梯度可以顺畅传递。
- 作者以数学推导为主线展开,解释了为什么这类低秩/绑定结构在优化上与直觉不同的底层机制。
「研究」频道最新
- RSIGame 递归自我改进训练 Agent,Qwen-27B 超越 GPT-5.5 且省 11 倍 token — RSIGame · 2026-10-01
- CoEvoWhen 策略-工具协同进化,搞定超长视频时间定位还省视觉 token — zju · 2026-10-01
- 北大 DC-SAE 实现 32 倍压缩,扩散训练收敛更快更省 — DAGroup-PKU · 2026-10-01
- DuoOPD 双结局策略蒸馏,Qwen3 上较 OPD 提升 5.98 个百分点 — Ao Yu · 2026-10-01
- RIDE:在表示空间外推 RL 方向,让蒸馏学生模型逼近或超越 RL 教师模型 — Hao Li · 2026-10-01
- KRAFTON 发布 GameSpec-Bench:100 份游戏设计文档考验 Agent 忠实度 — KRAFTON · 2026-10-01