腾讯论文提出环境进化:不盯 agent 也能持续生成更难的 RL 训练环境

omarsar0 · x · 2026-09-05

腾讯论文聚焦 agent RL 的环境供给瓶颈:随着 agent 变强,可学习的环境越来越稀缺,环境供给正成为 agent RL 的主要限制。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →