Agent 后训练困境:首步锁定策略,缺乏中途反思机制
omarsar0 · x · 2026-08-20
一篇新论文研究了 Agent 是否能真正通过后训练提升其他 Agent。分析发现,Agent 往往在第一步就锁定训练策略,剩余预算仅用于局部调整。尝试的三种修复方法中,基于经验的支架(scaffold)显著提升了执行效果(GSM8K +12.6,HumanEval +40.8),但策略依然僵化;人类引导虽能改变初始选择,但随后会滑回局部循环;增加推理算力仅对简单任务有效。核心痛点是 Agent 缺乏在执行中重新思考策略的能力。
「编程与Agent」频道最新
- Wisp 团队展示隐私优先AI工作流:本地处理结合TEE — bgmshana · 2026-08-21
- Claude 设置项禁止跨会话数据共享 — dotey · 2026-08-21
- 曝 Stripe 拟收购 OpenRouter:称 Agent 将成经济主体 — rohanpaul_ai · 2026-08-21
- Chroma 发布 Foundation:为 Agent 打造自演进记忆 — nbaschez · 2026-08-21
- Epho:一键在云端运行 Claude Code 的 API 服务 — karakanb · 2026-08-21
- 决策 Agent 无限索取证据时的停止规则设计 — ExtremeProgress2201 · 2026-08-21