COLM 2026 前瞻:元认知奖励 RL 与研究智能体等三篇工作

armancohan · x · 2026-10-06

作者预告将在 COLM 2026 会议上与合作者展示三项研究:基于元认知奖励的强化学习、基于 rubric 奖励的 opsd,以及持续进化的研究智能体,详情见后续推文串。

所属事件:研究者预告 COLM 2026 将展示元认知奖励 RL 等三篇论文(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →