Recirculation: 无需训练的推理架构大幅提升模型能力
chaumian · x · 2026-08-20
论文提出了一种在推理阶段增强现成基础模型架构的方法「Recirculation」,能显著降低困惑度并提升生成与推理任务的准确率。
核心特点:
- 推理时增强:在生成阶段几乎不增加额外延迟,仅在预填充阶段需要串行处理。
- 引入循环:通过特定形式的递归让模型作为动力系统跟踪信念状态,解决前馈 Transformer 深度限制。
- 自适应变体:仅需对超参数进行微调,冻结原模型权重。
效果:
在 Gemma3 系列上,自适应 Recirculation 实现了数据集上 23% 的困惑度降低,GSM8k 准确率提升 21%,并在其他下游任务上可靠提升。
所属事件:Recirculation:无需重训的推理时架构增强技术(2 条相关)→
「Infra」频道最新
- Scaling Law 不止是参数量,还看三件事 — natolambert · 2026-08-20
- 本地多智能体实测:第二个 Agent 提速 1.5 倍,第四个反而拖后腿 — AIForOver50Plus · 2026-08-20
- 如何管理 OpenAI、Anthropic 和 DeepSeek 多家 LLM 供应商? — Particular_Top_1439 · 2026-08-20
- 期待这世界遍地是数据中心的未来 — zck · 2026-08-20
- 观点:若 TerraFab 成功,算力成本将大幅降低 — teortaxesTex · 2026-08-20
- 预测 2031:模型更大、芯片更贵、算力成本飙升 — teortaxesTex · 2026-08-20