免训练「记忆增强压缩」:CoT 提速且 GSM8K 涨 21.4 分

rohanpaul_ai · x · 2026-09-01

一篇论文提出让思维链更便宜的新思路:把可复用的推理从生成阶段挪到 prompt 里——不要求 LLM 每次重新生成全部推理步骤,而是预先给出相关推理模式,让它「想得更短」。

Memory-Augmented Compression 无需训练:把已解出的样例蒸馏成可复用「推理记忆」,对每个查询检索相关记忆并注入到被压缩的推理之前。这把部分工作从慢速的自回归解码转移到更可并行的 prefill 阶段。

在 Qwen2.5-7B 上,为 Chain-of-Draft 加入记忆后在 GSM8K 恢复 21.4 个准确率点、MATH 恢复 28.0 个点,同时延迟仍比标准 CoT 分别快 1.49× 和 1.14×。

所属事件:免训练记忆增强压缩思维链:多基准涨分且提速近1.5倍(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →