Recurrent Looped Transformer:复用最终隐状态换取更深推理
WebAssemblyMan · reddit · 2026-09-16
作者介绍 Recurrent Looped Transformer(RLT)架构:将 decoder 的最终隐状态传回下一个 token,与该 token 的因果 encoder 表示一起输入;decoder 读取 encoder 派生的全局 KV memory,并在每一层维护滑动窗口注意力(SWA)缓存,同一更新过程对 prompt 和 response token 统一运行。核心卖点是更有效的推理深度(reasoning depth)。代码开源于 GitHub yifanzhang-pro/recurrent-looped-tranformer。
「研究」频道最新
- 教机械手用指尖走路:不用机械臂自行到达工位再干活 — Scobleizer · 2026-09-16
- 大规模搜索后无学习规则能胜过反向传播,Nature 2025 证实其生物学合理性 — aran_nayebi · 2026-09-16
- BoltzMol-1 十天万美元找到 WRN 抑制剂,最强 IC50 达 8.4 µM — GabriCorso · 2026-09-16
- Sakana AI 生物 plausible 学习遭质疑:只有 MNIST 不算数 — aran_nayebi · 2026-09-16
- 0.62 AUC 的粗筛模型撬动 65578 候选材料搜索,命中率翻倍 — bravo_abad · 2026-09-16
- NeurIPS 引用检查器揪出 LLM 改坏的 bib 文件,投稿面临风险 — suryanreddy · 2026-09-16