SPACE 方法让智能体少调 LLM 近八成成功率反升

Amazon 与微软合作论文 SPACE(已被 EMNLP 2026 接收)针对 ReAct 式智能体在长程任务中每轮只发一个原子动作、大量轮次浪费在重新决策常规序列上的低效问题,利用强化学习从成功轨迹中蒸馏动作块边界,学会哪些动作可以安全地连续执行。实验显示决策轮数最多减少 78.9%,成功率反而从 35.9% 提升到 67.2%,获 dairai 等推荐。

2026-09-04 ~ 2026-09-04 · 3 条相关