CMU 研究 Agent 该修订多少工作流:FULL 修复 15-16/20 优于 KEEP 13
CarnegieMellonU · hf · 2026-09-29
CMU 的 ControlScope 研究 LLM Agent 运行中该修订多少工作流:从同一公共执行状态出发,比较继续执行生成代码(KEEP)、编辑下一个工具调用的数据参数(ARG)、或从源头替换未完成工作流(FULL)三种修复路径,并用嵌套权限区分「可用修复」与「Agent 实际选择的动作」。
发现:
- 文件系统任务上 FULL 完成 15-16/20,优于 KEEP 的 13;但在快速推理评审下 FULL 反而退化到 10-13;
- ALFWorld 上 KEEP/ARG/FULL 差距很小(87 任务 85/86/87);AppWorld 585 实例官方测试净差异也小;
- 五次调用保护策略节省 19.4% 的模型输出日志,仅损失 1 次成功;
- 冻结回放显示存在被后续修订打断的有效 Agent 自写修复,以及更广采样策略漏掉更便宜成功编辑的案例。
核心结论:修复可及性与 Agent 的实际选择及后续执行密切相关。
「编程与Agent」频道最新
- 研究者开源 Fieldwork:让 Claude 自动记录探索任务清单 — anshulkundaje · 2026-09-29
- Skill2Env:从技能自动合成可执行环境,用于 agent 后训练 — AllSpark-Research · 2026-09-29
- Vercel Domains 上线免鉴权域名搜索,面向 AI agent 开放 API — cramforce · 2026-09-29
- 个人 agent 工作流怎么划分 repo?一锅炖还是按生活领域拆分 — Guyserbun007 · 2026-09-29
- 开发者自制自动分镜 App:ComfyUI 接本地 Gemma 一次生成 80 个场景 — Flaky_Comedian2012 · 2026-09-29
- 实测一天后:Sonnet 5.5 并非「便宜一半的 Opus」 — alexcovo_eth · 2026-09-29