Recirculation 无需重训为 LLM 增推理记忆,Gemma3 准确率升 21%
pbaylies · x · 2026-08-20
研究提出“Recirculation”技术,通过在推理时将深层信息反馈回浅层,赋予预训练 Transformer 工作记忆,解决上下文信息被埋没的问题。
核心机制:
- 在模型处理下一个 token 时,将部分已理解信息反馈回早期层。
- 让模型作为动态系统追踪信念状态,无需微调模型权重。
实验效果(Gemma3):
- 困惑度降低 23%。
- GSM8K 数学推理准确率提升 21%。
- 生成延迟几乎无增加(仅需 prefill 阶段串行处理)。
论文认为更好的记忆机制可能已存在于预训练模型中,Recirculation 只是让其持久化的方式。
所属事件:Recirculation:无需重训的推理时架构增强技术(7 条相关)→
「研究」频道最新
- 新基准 TRACES 评估 AI 发现能力,不只看最终答案 — rohanpaul_ai · 2026-08-20
- 新研究:推理时循环机制让冻结 LLM 困惑度降 23% — heghbalz · 2026-08-20
- SQLite 源码乱用 GOTO?揭秘 200 个操作码的性能玄机 — blaizedsouza · 2026-08-20
- Claude 挑战黎曼猜想未果但获数学突破 — PtrPomorski · 2026-08-20
- 企业 AI 试点频死? 因错把判别式任务交给生成模型 — Cold-Interview6501 · 2026-08-20
- MIT 研究:GPT-4 比说谎更糟,被质疑时越辩越强硬 — didiTonic · 2026-08-20