腾讯论文提出环境进化:不盯 agent 也能持续生成更难的 RL 训练环境
omarsar0 · x · 2026-09-05
腾讯论文聚焦 agent RL 的环境供给瓶颈:随着 agent 变强,可学习的环境越来越稀缺,环境供给正成为 agent RL 的主要限制。
- 现有方法的问题:从 agent rollout 暴露的弱点生成环境,会把 agent 自身的盲区继承进环境导致泛化差;且 agent 越强暴露弱点越少,学习信号随之衰减。
- 环境进化:完全不观察 agent,直接从多轮训练目标推导出三种提升环境难度的方法,按固定调度逐代施加。
- 验证:先用 Hy4 preview、Claude Opus 5、GPT-5.6 Sol 在进化后环境上测试,成绩下降证明难度确实提升后再投入使用。值得关注的环境供给侧新思路。
「研究」频道最新
- Tivadar Danka 绘制机器学习知识图谱:从基础到前沿 — TivadarDanka · 2026-09-05
- Thinking Machines 开源预测模型微调配方,用强化学习训练事件概率预测 — clarejtbirch · 2026-09-05
- Anthropic 上传 Lean 4 费马大定理完整机器验证证明 — scaling01 · 2026-09-05
- 无人值守跑了几个月:编码 agent 的七种隐性失败模式 — Fragrant_Yoghurt1135 · 2026-09-05
- Arohan 谈广义 RoPE:图像模型用 2D-RoPE 复数表示更易实现 — _arohan_ · 2026-09-05
- arXiv 论文辩论:高强度聊出幻觉的「AI 精神病」该否成为临床实体 — gerardsans · 2026-09-05