LOPD 方法让模型自学习特权上下文,提效 38%
青稞AI · wechat · 2026-08-27
新研究提出了 LOPD (Latent Privileged context Discovery) 方法,旨在解决传统强化学习(如 OPSD)依赖人工设计特权上下文(如答案、反馈)的局限性。
核心思路:
LOPD 让模型直接从历史经验中动态学习特权上下文,而不是依赖人工设定的固定规则。具体流程包括:
- 经验检索:从历史轨迹中提取有用信息。
- 潜变量编码:将经验转化为连续的 latent tokens。
- 监督生成:学生模型基于潜变量生成轨迹,并在每一步接收监督。
实验结果:
- 在工具使用和代码生成任务中,LOPD 的表现优于 RLVR 和 SDPO 等现有方法。
- 训练效率比 GRPO 高出 38%,且无需外部人工标注。
优势与局限:
- 优势:自适应性强,无需人工干预设计特权信息。
- 局限:依赖大量历史轨迹数据,在小样本或新任务场景下的表现仍有待验证。
「研究」频道最新
- 学者实测:2-3 轮迭代即可让前沿模型协作写出高质量评审 — anshulkundaje · 2026-09-21
- 学者计划每月 AI 辅助写 5-6 篇论文评审,效率翻倍 — anshulkundaje · 2026-09-21
- 学者呼吁建 AI 主导的科学期刊:投稿评审策展全交给 AI — anshulkundaje · 2026-09-21
- Waypoint Bio:AI 制药的瓶颈在数据而非模型 — anshulkundaje · 2026-09-21
- 研究估算:LLM 出现后美国自然失业率升约 0.1-0.2 个百分点 — mattbeane · 2026-09-21
- JevBench 开源:专注类型化决策模型的评测基准 — sull · 2026-09-21