SPACE论文:从成功轨迹蒸馏动作块边界,长程Agent决策轮数最多省78.9%

rohanpaul_ai · x · 2026-09-04

rohanpaul 补充了 SPACE 论文的 arXiv 原文信息(EMNLP 2026)。论文指出 ReAct 式「一轮一个动作」在长程任务中浪费大量 LLM 轮数,而朴素用 RL 训练变长动作块会坍缩成单动作或过度提交过长序列,根源都是学不会块边界。

SPACE 的做法:从成功轨迹归纳两层程序化技能,以子技能边界作为块边界监督,再通过混合 on-/off-policy 优化与块感知的 credit assignment 蒸馏出原始动作块策略。在 ALFWorld 与 ScienceWorld 上比最强基线成功率提升 7.0%-31.3%,LLM 决策轮数最多减少 78.9%。与同帖主前一条推文为同一论文。

所属事件:SPACE 方法让智能体少调 LLM 近八成成功率反升(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →