学生装不下专家策略?交互式模仿只需学对价值函数,离线则无解

When Does On-Policy Interaction Help? Representational Tradeoffs in Value-Based Imitation Learning

Luca Viano, Antoine Moulin, Audrey Huang, Volkan Cevher, Philip Amortila, Dylan J. Foster

cs.LG, cs.AI, stat.ML

2026-08-01

OVI 算法证明:学习者只要能表示专家价值函数,在线交互模仿就能逼近专家回报;同样假设下离线算法必随状态数爆炸,交互是必需的。

这篇在解决什么

模仿学习的目标是让一个学习体复制专家的行为。最直接的行为克隆(behavior cloning,BC)拿专家的轨迹去拟合每一步的动作分布,问题是只要学习者无法精确表示专家的策略,误差就会沿着时间步累积,性能卡在瓶颈。这在蒸馏里尤其常见:小模型的学生本来就装不下大模型专家的完整策略分布。

业界经验里有两条公认的缓解办法。一是在线交互(DAgger 这类):让学习者沿自己的轨迹去问专家该怎么走;二是基于价值的方法:先估出一个价值函数,再由它导出策略,不去直接拟合专家的整张动作分布。这篇要回答的是:这两条路到底为什么有用,以及它们之间是否互相成就。

方法

核心结论一句话:在线交互降低了对学习者的表示要求。匹配专家的回报(return)只需要学习者能表示专家的价值函数 Q^πE,而策略法要求的是更严格的「能表示专家策略 πE 本身」。在蒸馏这类场景里,前者往往比后者容易满足得多。

OVI(On-policy Value-based Imitation)把这个想法落成算法。它借助性能差引理(performance difference lemma),把「策略离专家回报还差多少」写成关于价值函数的极大极小博弈,策略方和 Q 方对弈。真正关键的设计是逐层求解:策略方一次只优化一个时间步,因为第 h 步的状态分布只取决于前面那些已经定下来的步,可以先把采样分布固定,再去优化当前层的策略。计算上只需要一个线性最大化预言机(linear maximization oracle)给 Q 方做更新,不碰难解的约束。

结果

论文用一张「可实现性—可解性」的总表把结论收拢:

表示假设离线模仿学习交互式模仿学习
奖励可实现不可解不可解
价值函数 Q^πE 可实现不可解可解(OVI)
策略 πE 可实现可解(BC)可解(DAgger)

这张表的关键信息是:价值函数可实现这条路,只有在允许交互时才走得通。定理 3.1 给出 OVI 在 Q^πE 可实现假设下的样本复杂度约 Õ(H⁵Q⁴log|Q|/ε⁴) 次专家查询,且不依赖学习者的策略类;如果价值类是凸的,速率改善到 Õ(ε⁻²)。

配套的定理 4.1 是个下界:即便价值类小到只有两个函数、时间跨度只有两步,任何离线算法也至少需要 Ω(min{|X|, log|F|}/ε) 条专家轨迹,样本随状态数爆炸。这就把「交互是必需的」钉死了:同样弱的假设下,离线就是无解。

实验在 Gymnasium 的四个环境(Acrobot、CartPole、Pendulum、LunarLander)上做。专家是两层各 64 神经元的网络,学习者保持同样深度但宽度从 2 缩到 64,50 个随机种子。宽度为 64 时 BC 和 DAgger 表现都不错,网络一缩小它们就掉,OVI 在所有尺寸上都领先,最小的宽度也能学好。在一个合成的 Q^πE 可实现 MDP 里,OVI 的回报次优收敛明显快于 DAgger,而且它匹配的是专家的回报而非整条轨迹分布(与专家的轨迹 TV 距离始终不为零)。原因在于这个环境里有约 2^|X| 种最优策略,对学到的价值函数贪心就够了,而 DAgger 非要处处匹配专家动作,反而更难。

为什么重要

对做模型蒸馏的人来说,这篇给了一个清晰的指引:当学生比专家小很多时,基于价值的在线蒸馏可能胜过基于策略的在线蒸馏。理论上它把「交互到底买到了什么」说清楚了,买到的正是表示上的松弛,从策略松弛到价值。作者也坦白这是语言模型蒸馏里还没验证的方向,但机制是直接可试的。

局限与存疑

OVI 对时间跨度 H 的依赖比策略法(BC、DAgger)更差,这是否本质尚属开放问题。非凸的价值类只有 Õ(ε⁻⁴) 的速率,Q-OVI 变体能把速率提到 Õ(ε⁻²),却需要把价值类离散化,对神经网络这类连续大类在计算上不友好。OVI 学到的是非平稳策略,内存和算力随 H 线性增长,平稳近似在实验里管用但理论上还没有保证。实验只在小规模 Gym 上做,语言模型蒸馏这条最该验证的路还没碰。

术语

原文与代码

社区讨论

相关论文

全部论文解读