无需再训练,DeepMind 用 Recirculation 让模型推理时递归进化
omarsar0 · x · 2026-08-23
Google DeepMind 提出一种无需再训练的模型架构进化方法 Recirculation。传统前馈 Transformer 受限于层数,难以处理长序列的状态跟踪。该方法通过在预填充阶段将激活反馈给自身,使模型在推理时像动态系统一样运作,无需重训即可跟踪信念状态。生成成本保持平坦,所有串行工作均在预填充阶段完成。
「研究」频道最新
- Ethan Mollick:基于旧模型的 AI 研究需谨慎 — emollick · 2026-08-24
- EMNLP 录用:构建多图医学推理基准数据集 — yuyinzhou_cs · 2026-08-24
- Agent 架构实践:从正则解析转向编译时语义拦截 — demirtasfurkan_ · 2026-08-24
- 研究揭示:优化 Scaffolding 可让弱模型逼近前沿水平 — rohanpaul_ai · 2026-08-24
- NeurIPS workshop非存档性质对申研影响几何?网友热议 — Wonderful_Entry9371 · 2026-08-24
- Φ-Bench 发布:LLM 能否优化自身基础设施? — 青稞AI · 2026-08-24