研究者预告 COLM 2026 将展示元认知奖励 RL 等三篇论文

一位研究者预告将在 COLM 2026 会议上与合作者展示三项研究工作,包括基于元认知奖励的强化学习、基于 rubric 奖励的 opsd,以及一个持续进化的研究智能体。其中元认知奖励方法旨在让大模型的不确定性表达更加忠实,作者表示将在后续推文串中公布三篇论文的详细内容与安排。

2026-10-06 ~ 2026-10-06 · 2 条相关