论文提议给语言模型加「睡眠期」:离线巩固记忆以突破长文本瓶颈
rohanpaul_ai · x · 2026-08-13
针对 Transformer 智能体在长上下文中因注意力机制导致计算变慢、成本激增的问题,一篇新论文提出了创新解法:为模型引入睡眠阶段(sleep phase)。
核心机制
- 离线巩固:模型会暂停执行任务,多次重读近期的上下文,将有用信息提取并写入固定大小的记忆层(状态空间块中的快速权重),随后清空短期注意力缓存。
- 推理无损:这种设计让模型在“睡眠”时付出额外算力整理记忆,但在实际回答和预测时,依然只需 1 次前向传播。
实验结果
研究者在细胞自动机、图查找和 GSM-Infinite 数学问题等测试集上进行了评估。结果表明,模型必须利用已不在注意力缓存中的旧信息来解题。更长的睡眠时间能显著提升模型表现,尤其是在需要深度推理而非单纯记忆事实的困难任务中。
这一突破意味着,长周期智能体或许无需无限增加原始上下文窗口,而是可以通过“记忆巩固+遗忘”来实现高效的长线运作。
「编程与Agent」频道最新
- 实测 OpenAI 模型玩扫雷翻车,求提示词优化方案 — NazgulResebo · 2026-08-13
- Keep:为AI编码助手打造的跨会话共享记忆库 — iannuttall · 2026-08-13
- 专家指出:能做好代码重构的模型蕴含万亿级市场 — zacharylipton · 2026-08-13
- 开源 AI 渗透测试工具 Strrix:自主挖掘并验证应用漏洞 — alex_verem · 2026-08-13
- 一人公司实操:用 AI 全方位自动化本地生意的 10 个工作流 — boringmarketer · 2026-08-13
- OpenAI Codex被吐槽:干活时黑盒,用户不知进度 — OfirPress · 2026-08-13