免训练记忆增强压缩 CoT:多基准涨分且提速近 1.5 倍
dreamwieber · x · 2026-09-01
arXiv 论文《Memory Augmentation Unlocks Efficient Chain-of-Thought Reasoning》提出一条给思维链(CoT)降本的新路:把可复用的推理从生成端挪到 prompt 端。
核心思路:
- 不让 LLM 每次都重新推理,而是从历史推理轨迹中提炼出「可复用推理记忆」(总结推理模式、关键约束与关键操作),检索后作为 prefill 侧脚手架直接给模型,让它想得更短。
- 免训练框架,称为 Memory-Augmented Compression;论文还把这种权衡形式化为「Context-Generation 替代律」。
实验结果:在 GSM8K、MATH、BBH、MMLU-Sci 上,相比 Chain-of-Draft(CoD)压缩分别提升 21.4 / 28.0 / 29.5 / 6.61 分,同时比标准 CoT 获得 1.14-1.49 倍延迟加速。该记忆机制与 token 级、推理轨迹级、推理状态级压缩方法兼容。
所属事件:免训练记忆增强压缩思维链:多基准涨分且提速近1.5倍(2 条相关)→
「编程与Agent」频道最新
- AI 时代代码需被解释而非被人类理解 — kieranklaassen · 2026-09-01
- 自研工具结合 AI 生成教材打造互动学习流 — generativist · 2026-09-01
- Agent 难读 LinkedIn:主流社交平台封杀 AI 爬虫 — Dry_Steak30 · 2026-09-01
- 无需向量库:用状态驱动协议解决 LLM 上下文崩塌 — wenger2026-12 · 2026-09-01
- 用 Rust 运行时约束 AI 编写并发程序的实践 — doodlestein · 2026-09-01
- 16GB 显存跑 Qwen 27B:llama.cpp MTP 改版提速 17% — ea_man · 2026-09-01