SPACE 方法让智能体少调 LLM 近八成成功率反升
Amazon 与微软合作论文 SPACE(已被 EMNLP 2026 接收)针对 ReAct 式智能体在长程任务中每轮只发一个原子动作、大量轮次浪费在重新决策常规序列上的低效问题,利用强化学习从成功轨迹中蒸馏动作块边界,学会哪些动作可以安全地连续执行。实验显示决策轮数最多减少 78.9%,成功率反而从 35.9% 提升到 67.2%,获 dairai 等推荐。
2026-09-04 ~ 2026-09-04 · 3 条相关
- SPACE 方法砍掉 78.9% Agent LLM 调用,成功率反而提升 — dair_ai · 2026-09-04
- Amazon与微软论文:LLM智能体无需每步决策,成功率从35.9%升至67.2% — rohanpaul_ai · 2026-09-04
- SPACE论文:从成功轨迹蒸馏动作块边界,长程Agent决策轮数最多省78.9% — rohanpaul_ai · 2026-09-04