SPACE论文:从成功轨迹蒸馏动作块边界,长程Agent决策轮数最多省78.9%
rohanpaul_ai · x · 2026-09-04
rohanpaul 补充了 SPACE 论文的 arXiv 原文信息(EMNLP 2026)。论文指出 ReAct 式「一轮一个动作」在长程任务中浪费大量 LLM 轮数,而朴素用 RL 训练变长动作块会坍缩成单动作或过度提交过长序列,根源都是学不会块边界。
SPACE 的做法:从成功轨迹归纳两层程序化技能,以子技能边界作为块边界监督,再通过混合 on-/off-policy 优化与块感知的 credit assignment 蒸馏出原始动作块策略。在 ALFWorld 与 ScienceWorld 上比最强基线成功率提升 7.0%-31.3%,LLM 决策轮数最多减少 78.9%。与同帖主前一条推文为同一论文。
所属事件:SPACE 方法让智能体少调 LLM 近八成成功率反升(3 条相关)→
「编程与Agent」频道最新
- 开发者用 Codex 复刻暗黑破坏神玩法,自称 Path of Codex — Dimillian · 2026-09-04
- GPT-6 演示:在 Blender 里全自动建模,一键导出 UE5 关卡 — petewoodbridge · 2026-09-04
- Gemini CLI、Crush 与 Chrome DevTools MCP 到底该怎么选 — Different_Regret_146 · 2026-09-04
- OpenClaw 新手引导大改版,手机与 Mac 双网关一键配好 — steipete · 2026-09-04
- Instinct 创始人推出免界面个人 agent,藏在 iMessage 与 WhatsApp 里 — Scobleizer · 2026-09-04
- Codex 启动 Playwright 易现竞态卡死,AGI 也难解基建稳定性 — cto_junior · 2026-09-04