ICML 2024 论文 RAFA 重构 LLM Agent 闭环规划系统
zhaoran_wang · x · 2026-07-29
RAFA 把 LLM Agent 设计成“先规划、再执行、持续重规划”的闭环系统
这篇 ICML 2024 论文 Reason for Future, Act for Now (RAFA) 把 LLM agent 视为一个由 学习、规划、行动 组成的闭环系统。
- agent 通过 memory buffer 记录历史反馈,用过去的交互来更新判断;
- 它先做 长程规划,生成未来轨迹,再执行当前一步的动作;
- 每轮交互后都会把新状态、动作、奖励写回记忆,并基于新状态 重新规划;
- 论文还声称在样本效率上更优,并给出了 理论 regret 保证。
原帖的核心判断是:放到今天看,这套思路和自主智能体、在线 RL、test-time adaptation、memory-based reasoning 的方向非常契合,显得相当前瞻。
「编程与Agent」频道最新
- Andrew Ng 12 页笔记拆解多智能体系统四种设计模式 — theomitsa · 2026-07-29
- 一块 GPU 多台虚拟机共享:直通、vGPU 与 API remoting 详解 — LoganGrasby · 2026-07-29
- Maven 热门课讲清 AI Agent 的第一性原理搭建 — hugobowne · 2026-07-29
- Unreal Engine 为何难以适配 agentic 工作流:文件、代码和文档都在作梗 — nptacek · 2026-07-29
- AI Agent 不会替代你,却能替你干掉大量重复工作 — dotey · 2026-07-29
- LLM 编程工作流加上研究门控,避免把所有论文方法都实现进去 — hypergraphr · 2026-07-29