无需重训,新方法让基础模型自改架构提升推理能力
TheGradient · x · 2026-08-20
论文提出了一种名为“循环”的推理时架构增强技术,无需重新训练即可显著降低困惑度并提升生成与推理任务的准确率。
核心原理与优势:
- 引入递归机制:通过特定形式的递归让模型作为动力系统跟踪信念状态,突破前馈 Transformer 深度限制。
- 零延迟成本:生成阶段几乎无额外延迟(仅在预填充阶段需串行处理)。
- 自适应变体:仅需微调超参数即可冻结原权重应用,在 Gemma3 系列上困惑度降低 23%,GSM8k 准确率提升 21%。
该研究展示了一条通过模型自身属性指导架构演化的新路径。
所属事件:Recirculation新方法无需重训即可提升模型推理能力(3 条相关)→
「模型」频道最新
- 实测 Qwen3.8-27B 在 16GB 显存下的 13 万上下文性能 — BuffMcBigHuge · 2026-08-20
- 前沿模型暂停期将结束:Astra 与 Fable 5.1 拟 9 月发布 — bindureddy · 2026-08-20
- GPT-5 与 Gemini 2.5 Pro 夺国际天文奥赛金牌 — hhsun1 · 2026-08-20
- Steerling-8B:训练时植入可解释性的扩散模型 — burny_tech · 2026-08-20
- Qwen3.8-27B 深度剪枝版发布:参数减至 22.7B — peplo1214 · 2026-08-20
- ChatGPT 自动将英文对话标题生成为简体中文 — lakelifebrando · 2026-08-20