Schmidhuber:1991 年 Fast Weights 才是首个 Transformer,比 GPT 早 30 年
SchmidhuberAI · x · 2026-09-19
- Schmidhuber 回应「果蝇的快速权重持续学习是现有 LLM 做不到的」的说法,认为并不准确,并重申其 1991 年的 Fast Weight Programmers 研究。
- 1991 年他发表的 ULTRA 在数学上等价于今天的非归一化线性 Transformer:前馈网络通过梯度下降学会对另一个网络的「快权重」编程,计算成本随输入规模线性增长而非平方级,比后来的二次方 Transformer 更省算力。
- 同年他还提出了深度网络的自监督预训练,即 GPT 中的「P」。当时算力比现在贵约百万倍,算力限制反而催生了更高效的架构。该文与其元学习(metalearning)研究一脉相承。
「研究」频道最新
- 研究发现:科学之美与影响力出人意料地正相关 — jacobkimmel · 2026-09-19
- 把 reranker 改成决策引擎,Jev 式 API 电车难题永远拉杆 — gaganghotra_ · 2026-09-19
- 连续扩散语言模型新技巧:仅增 1-3% 推理算力即可引导生成 — itsbautistam · 2026-09-19
- 用 LLM 算历代名将 WAR:拿破仑稳居历史第一 — ctjlewis · 2026-09-19
- MIT 新论文追踪 10.8 万个开源模型的生命周期兴衰 — asusarla · 2026-09-19
- Meta Muse + Jev 十秒级筛出免疫学百大未解问题 — DeryaTR_ · 2026-09-19