LOPD 方法让模型自学习特权上下文,提效 38%

青稞AI · wechat · 2026-08-27

新研究提出了 LOPD (Latent Privileged context Discovery) 方法,旨在解决传统强化学习(如 OPSD)依赖人工设计特权上下文(如答案、反馈)的局限性。

核心思路:

LOPD 让模型直接从历史经验中动态学习特权上下文,而不是依赖人工设定的固定规则。具体流程包括:

实验结果:

优势与局限:

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →