SPACE 方法砍掉 78.9% Agent LLM 调用,成功率反而提升
dair_ai · x · 2026-09-04
dairai 推荐 SPACE 论文,解决长程 Agent 中 ReAct 每轮只发一个原子动作、大量轮次浪费在重新决策本无悬念的常规序列上的问题。
要点:
- 直接用 RL 训练变长动作块会失败:策略学不会块该在哪里结束,要么退回单动作,要么commit过长序列。
- SPACE 从已有数据中自动提取两级程序化技能,用子技能边界直接作为动作块边界监督信号。
- 再用混合 on/off-policy 优化与 chunk-aware credit assignment,把时间结构蒸馏进 primitive-chunk 策略。
结果:LLM 调用减少 78.9%,成功率同时提升。
「编程与Agent」频道最新
- 企业 Agent 实战课程开课:学员来自 PlayStation、Salesforce 等 — hugobowne · 2026-09-04
- 数学家实测 GPT-6 Astra:边写论证边在 Lean 里实时验证证明 — teortaxesTex · 2026-09-04
- 称 GPT-6 Astra 耗时一周在虚幻引擎逐街建成曼哈顿世界 — jasonkneen · 2026-09-04
- Makepad flow:Rust 单可执行文件版 ComfyUI 一天造出 — anselm · 2026-09-04
- antirez:评价新模型别看 three.js demo,看它能否解决真实阻塞难题 — antirez · 2026-09-04
- 在 Gemini Enterprise 内跑通 MCP App,实时展示 Cloud Run 服务 — rseroter · 2026-09-04