Qwen 团队提出 Elastic Horizon,动态界定了智能体 RL 的交互边界
dair_ai · x · 2026-09-11
dair-ai 推荐 Qwen 团队关于 agentic RL 中「交互视野调度」的新论文——这是一个被低估的控制问题。
核心发现
- 提高每条 episode 的最大环境交互次数能改善长程智能体表现;扩展视野的课程式方法优于固定视野训练。
- 但现有调度是开环的:只能单调递增到人工设定的上限,无法检测「继续扩展已无收益」。
方法
- 作者提出「有效交互边界」(effective interaction frontier):超过该边界后,额外交互收益递减,而成本仍线性增长。AppWorld 和 BFCL 上的固定视野扫描显示出明显的饱和平台。
- Elastic Horizon 是闭环控制器,利用成功轨迹长度的 90 分位数(训练中本就可得的统计量)来动态追踪该边界。
「编程与Agent」频道最新
- 实测各 LLM 订阅真实代币价值:Grok Heavy 40 倍 ROI 最高 — thesaraharminta · 2026-09-11
- 把 Claude 当新队友配置,交接集成零会议,QA 96 分钟回报 — max_gladysh · 2026-09-11
- Replit 上线 Routines 自动化功能,还支持设置预算 — amasad · 2026-09-11
- 把 Replit Agent 装进机器人:自主建站并一键发布 — amasad · 2026-09-11
- 开源 OmniGet 支持 1800+ 站点下载课程视频并转写整理 — tom_doerr · 2026-09-11
- 独立开发者用 Fable 造群聊应用:AI 自己加班加了两个'惊喜'功能 — RileyRalmuto · 2026-09-11