Amazon与微软论文:LLM智能体无需每步决策,成功率从35.9%升至67.2%
rohanpaul_ai · x · 2026-09-04
Amazon 与微软合作论文提出 SPACE,解决长程智能体「每步都要 LLM 决策」的低效问题。核心难点不是简单批量执行动作,而是学会哪些动作可以安全地连在一起跑。
方法思路:
- 从成功轨迹中归纳两层程序化技能,把子技能边界作为动作块(chunk)边界的监督信号
- 通过混合 on-/off-policy 优化将这种时间结构蒸馏进一个可输出变长动作序列的策略,测试时无需技能库
效果:在 ScienceWorld 上成功率从 35.9% 提升到 67.2%,LLM 决策轮数从 10.2 降到 5.2;论文摘要称在 ALFWorld 与 ScienceWorld 上相比最强基线提升 7.0%-31.3%,决策轮数最多减少 78.9%。结论:不要让智能体对每个微小动作反复推理,也不要盲目批量执行,而是训练它学会何时继续行动、何时重新观察。
所属事件:SPACE 方法让智能体少调 LLM 近八成成功率反升(3 条相关)→
「编程与Agent」频道最新
- Codex 启动 Playwright 易现竞态卡死,AGI 也难解基建稳定性 — cto_junior · 2026-09-04
- Claude 纯代码造出可交互 3D 餐厅:可走动倒咖啡无任何下载 — prasenx · 2026-09-04
- Claude Code 作者称写码不再是瓶颈,开发者用三个 skill 自动化创业验证 — Arindam_1729 · 2026-09-04
- 用 Ollama+Python 搭本地 AI 助手与多 Agent 研究员的学习路线 — goyalshaliniuk · 2026-09-04
- 五个比课程更涨功底的 AI 实战项目:从 RAG 到多 Agent 研究 — goyalshaliniuk · 2026-09-04
- 开发者将开源云端 Agent 自托管方案,用自有硬件跑编程数月 — lucasmeijer · 2026-09-04