Flux-OPD:用动态上下文破解开放域大模型蒸馏难题

ZenMoore1 · x · 2026-08-01

开放域大模型训练因缺乏可验证奖励,难以进行有效的偏好监督。这篇论文提出了 Flux-OPD(基于动态上下文的在线策略蒸馏范式)。

其核心机制在于:根据学生模型的训练状态动态更新教师模型的指导上下文,并将上下文差异作为修正信号注入到无上下文的教师锚点中。同时,通过数学分解反向 KL 散度目标,利用冲突项来加权控制修正强度,从而解决蒸馏目标不稳定和分布冲突的问题。

实验表明,该方法在视频提示词优化和医疗问答等开放式任务上,表现优于现有的 OPD 范式。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →