NestRL:嵌套训练法让人机组队实现相互适应,入选 NeurIPS
rao2z · x · 2026-09-25
- Kambhampati 团队(亚利桑那州立大学与科罗拉多州立大学合作)论文 NestRL 被接收,提出面向人机组队(Human-AI Teaming)的嵌套强化学习训练框架。
- 核心问题:人类队友会随 AI 行为自适应调整策略,而现有方法用静态训练伙伴,无法刻画这种自适应性;标准多智能体联合训练又容易收敛到只在共训伙伴间有效的「黑箱默契」,泛化差。
- 方法:将人机组队形式化为 Interactive POMDP(I-POMDP),在每一层用下一层的自适应智能体作为对手/伙伴训练,逐层嵌套,让智能体暴露于自适应行为的同时避免收敛到伙伴特定策略。
- 结果:在 Overcooked 环境中对比 SOTA 基线,NestRL 对未见过的自适应智能体和真实人类队友都取得更高任务表现,且在交互过程中表现出显著更强的适应能力,附理论分析支撑。
「具身」频道最新
- 特斯拉 FSD 轻松应对斯洛文尼亚老城超窄陡坡街道 — yunta_tsai · 2026-09-25
- 机器人创企 Feather 出潜:通用机器人 2.99 万美元,获 760 万美元融资 — darian314 · 2026-09-25
- UC伯克利与普林斯顿发布TANGO框架,让人形机器人全身控制穿越狭窄空间 — shahdhruv_ · 2026-09-25
- 特斯拉 Robotaxi 车队曝光:420 辆 Model Y 加 69 辆 Cybercab — bendomingueztv · 2026-09-25
- NVIDIA 分享 Cosmos 3 仿真路线:用可验证奖励加速物理 AI 开发 — liu_mingyu · 2026-09-25
- C5R 12 周建成全 AI 运营实验室,并推出 SciUniverse 基准 — akilian · 2026-09-25