普林斯顿实验:AI agent 写的机器人规划程序胜过专家系统
ziv_ravid · x · 2026-10-09
普林斯顿 Tom Silver 团队论文《Coding Agents for Generalized Task and Motion Planning Problems》做了一个实验:给基于 LLM 的通用编码 agent(如 Claude Code、Codex)一个机器人任务与运动规划问题、一个模拟器和 20 美元算力预算,看它能否写出比专家手工构建的系统更好的求解程序。
结果是能,而且差距明显:agent 写的程序成功率显著高于专家系统,速度也快得多。
博主 Eyal Weiss 进一步审查了 112 份 agent 生成的程序,想找有没有新算法——一个都没有。agent 做的其实是「很好的工程」:把几十年前的成熟方法挑选出来,针对具体任务精细调参适配,缺什么数据就补什么。
原文还解释了任务与运动规划(task and motion planning)问题本身:机器人要同时决定「做什么」(挪开哪些物体、用不用工具)和「怎么动」(手臂精确路径),两者互相纠缠,传统做法需要专家为每类问题手工编写动作词汇表,耗时且搜索慢。
「编程与Agent」频道最新
- 把 3D 航海游戏直接塞进 X 帖子,Claude Opus 一把造出 — prasenx · 2026-10-09
- edith-1 专抓 agent 失败与 reward hacking,准确率超 Sonnet-5.5 成本仅 1/274 — xennygrimmato_ · 2026-10-09
- edith-1 架构补充:概率过滤器初筛,失败轨迹交由昂贵 judge 深查 — xennygrimmato_ · 2026-10-09
- Agent 基础设施初创 Solari 发布:浏览器 8ms 启动,比 Browserbase 快 10 倍 — Scobleizer · 2026-10-09
- Splash 1.3.0 上线:SSD 卸载让本地 agent 首 token 从 19 秒降到 1 秒 — BeidiChen · 2026-10-09
- OpenAI 编码 Agent steering 改为即时响应,并放出 ultrafast 新版 — Dimillian · 2026-10-09