编程智能体做任务与运动规划:成功率 56%-95% 超越人工规划器
FBK-NLP · hf · 2026-09-25
FBK-NLP 团队研究编码智能体能否自动化广义任务与运动规划(Generalized TAMP):给定任务描述和模拟器访问,智能体在固定综合预算内通过与环境交互开发程序,程序冻结后在未见过的实例上评估。
- 测试了 Claude Code (Opus 5) 与 Codex (GPT-5.6 Sol、GPT-6 Astra),覆盖 KinDER 和 PDDLStream 的 28 个模拟环境;
- 共评估 980 个生成程序 × 每个环境 100 个保留实例,总计 98,000 次评估;
- 三种智能体配置在 16 个有规划器可用的环境中平均成功率 56%-95%,超过手工规划器的 47%、一次性生成和 LLM 广义规划基线;
- 物体数量增加时,智能体程序保持更高成功率,且每实例计算量低约一个数量级;
- 日志显示智能体利用交互校准物理模型、测试边界情形、迭代策略;
代码与完整 prompt 已开源。结论:编码智能体是广义 TAMP 的强力基线。
「编程与Agent」频道最新
- 176 组对照实验:Agent Harness 设计对成绩影响被系统量化 — alex_verem · 2026-09-25
- 上下文溢出致 78.7% 任务失败:Harness 设计实验拆解 Agent 成绩 — alex_verem · 2026-09-25
- LangChain 提出「循环工程」:Agent 是层层嵌套的四层循环 — bibryam · 2026-09-25
- Reddit 实践复盘:AI Agent 有用与否,关键在划定停止点 — Inner-Town-5609 · 2026-09-25
- theo:Claude Code $200 套餐已反超 Codex,数周内形势逆转 — ssh4net · 2026-09-25
- 容器算不算安全边界?开发者热议沙箱选型,Kata 与 Firecracker 受推 — andreamichi · 2026-09-25