Agent-G²:用高斯分布优化长期任务强化学习
ZhejiangUniversity · hf · 2026-08-27
Agent-G² 提出将提示深度建模为高斯分布,并从现有轨迹中在线估计。这种方法在无需额外探测的情况下,改善了长期任务上的强化学习性能。
「研究」频道最新
- 利用流式 API 窃取 Gemini 2.5 隐藏架构与优化 — delliott · 2026-08-27
- DSH 论文探讨时空可组合性编程范式 — teortaxesTex · 2026-08-27
- 深至科技用 AI 智能体解决乳腺癌患者长期管理难题 — 机器之心 · 2026-08-27
- ECCV 2026 论文 OmniColor:统一多模态线稿上色框架 — 机器之心 · 2026-08-27
- Hugging Face 事故复盘:模型策略意识引争议 — akbirkhan · 2026-08-27
- 回顾新冠时期的医院分诊聊天机器人实践 — AryHHAry · 2026-08-27