研究称2层循环网络在同等算力下比肩32层前馈基线
mike64_t · x · 2026-09-26
一条研究性长推指出:只要模型能记住上一步的状态,2 层循环网络(recurrent network)在相同计算预算下可以匹配 32 层前馈网络的基线表现。
作者的判断是:当前的算力开销可能花在了错误的维度上——与其堆叠更多层,不如把算力投入到让模型具备跨步记忆的循环结构上。推文附有完整线程展开论证。
「研究」频道最新
- 论文提出用 LLM 做「可证明完备」的广义规划新方法 — JFPuget · 2026-09-26
- Meta 与 CMU 推出 TrackEverything:1000+ 帧长视频 3D 点追踪 — AdamWHarley · 2026-09-26
- ICML 2027 程序主席求助:AI slop 投稿爆炸怎么管 — MarkSchmidtUBC · 2026-09-26
- 开源 Jevless:任意带 logprobs 的模型实现 Jev 式结构化决策 — seraphius · 2026-09-26
- 物理博客主披露为 Anthropic 写稿内幕:收费居中水平、拒签 NDA — burny_tech · 2026-09-26
- 论文《Mecha-nudges for Machines》入选 NeurIPS 2026 Spotlight — ethayarajh · 2026-09-26