把标注当oracle避开组内优势反转,时序mIoU从62.5到66.0

Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou, Ming-Ming Cheng

cs.CV

2026-08-21

南开大学等提出OraRL:把每条标注写成oracle rollout,用解耦优势估计避开组内优势反转。Video-ORA-9B把时序mIoU从62.5做到66.0,VSI-Bench 73.1,相对GPT-5的55.0高出18.1点。

这篇在解决什么

视频 MLLM 的细粒度感知卡在后训练,不卡在模型规模。时序定位、跟踪、分割、空间理解这些任务上,GPT-5 和 Gemini-3-Pro 经常打不过 10B 以下的开源专精模型。SFT 把标注当最大似然目标,只把输出格式学像,分不清「差一点」和「完全错」。GRPO 这类组内相对策略优化改用同一 query 的多条 on-policy rollout 比奖励,但标注只当打分器:精确区间、框、mask、轨迹很少被采样命中,组里经常没有可靠的正样本。再叠 chain-of-thought 把每条 rollout 拉长,训练和推理都更贵,分数却不见涨。

多喂 prompt 也换不来稳定提升。样本效率才是瓶颈。

方法

OraRL 的原则叫 annotation-as-rollout:把标注序列化成模型的回答格式,作为 oracle rollout 追加进组,不替换任何 on-policy 样本。多选题、时间区间、空间框、框轨迹、带时间戳的分割提示都能这么接,不依赖任务语义。

直接混进组会翻车。oracle 奖励高,组均值被抬高,原来高于 on-policy 均值的 rollout 会拿到负优势。这叫优势反转(advantage inversion),反转带宽跟 oracle 与策略的奖励差成正比。对照实验里,naive 注入把三任务平均从 GRPO 的 60.3 打到 55.4,跟踪掉 11.9 点。11,503 个组、92,024 条 rollout 上,这种方法把 22.4% 本该为正的样本翻成负;42.5% 的组至少翻一条,8.3% 的组正样本被清空。跟踪最惨,翻号率 38.7%。

OraRL 把优势拆开处理:

Tempsamp-R1 靠按任务手调 reward shaping 压反转。OraRL 用 on-policy 奖励和 oracle-policy 差距算优势,同一条更新规则覆盖所有能写成回答格式的标注。

结果

Video-ORA 用 Qwen3.5 骨干,SFT 约 28.5 万、RL 约 10 万条 prompt,七个任务族一套配方,推理不走 CoT。

任务指标Video-ORA-9B对照
TimeLens 三套时序 groundingmIoU 宏平均66.0TimeLens2-8B 62.5
GOT-10k 跟踪AO78.2OneThinker-8B 73.0
MeViS 视频分割J&F61.3OneThinker-8B 52.7
VSI-Bench宏平均73.1GPT-5 55.0, Gemini-3-Pro 55.1
空间三榜宏平均VSI+MMSI+MindCube56.1先前最佳约 51.0

Charades / ActivityNet / QVHighlights 的 mIoU 分别是 61.8、63.6、72.5,对 TimeLens2-8B 的 58.6、58.6、70.2。ActivityNet 上 [email protected] 拉开 6.7 点:粗检索骨干就会,精确边界才是采样稀缺、标注能补上的东西。Video QA 七榜宏平均从骨干 61.9 到 66.8,VideoHolmes 单榜 +15.2。RefCOCO 家族八个 split 的 [email protected] 全第一。STVG 上空间 [email protected] 相对 Qwen3.5-9B +15.5,时间 [email protected] 只 +3.0。分割相对骨干跳得最大:MeViS J&F 从 32.1 到 61.3,ReasonVOS 从 21.5 到 63.7,骨干自己吐不出能用的 mask 提示。

0.8B 到 9B 四个尺度都超过对应骨干,宏平均从 51.8 升到 66.2。数据从 6.4k 到 100k prompt,OraRL 视频感知聚合 +5.2、空间智能 +3.6,GRPO 只有 +2.8 和 +3.1。CoT 帮不上忙:加思维链的 GRPO 时序平均 58.5,不加是 58.7,步时却从 93.9 秒涨到 135.6 秒。OraRL 答案-only 平均 61.4,步时 62.4 秒。相对 SFT,OraRL 步时约 2.2×,GRPO+CoT 约 4.9×。κ=0.5 剪枝把步时从 92.5 秒砍到 62.4 秒,平均分只掉 0.4,峰值显存 62.4 GB 降到 50.9 GB。十分钟视频、2 fps、约 12 万视觉 token,Video-ORA-9B 中位端到端 24.3 秒对骨干 29.0 秒;生成阶段 130 ms 对 4,780 ms。

为什么重要

视频感知 RL 的正样本稀缺是系统性的。标注不该只当 reward 函数,它本身就是组里最稳的正样本;必须把 oracle 从基线里拿出来,否则 naive 注入会比 GRPO 更差。对要训 unified video MLLM 的人,这是一套不靠 CoT、能从 0.8B 扩到 9B、数据加到 10 万 prompt 还在涨的配方。代码、数据和权重都已公开。

这仍是渐进改进:目标函数还是 GRPO 的 clipped importance ratio,改的是组构成、优势估计和剪枝。

局限与存疑

每条标注都要能序列化成合法 oracle,并用标量任务奖励评估。模糊、部分、噪声监督和 learned oracle 没测过。空间推理里路线规划仍落后 Gemini-3-Pro 和 GPT-5;MMSI-Bench 与 MindCube 平均 47.7,低于 Grok-4 的 50.7。ReVSI 校正协议上 Video-ORA-9B 从 VSI-Bench 掉 14.9 点,骨干只掉 6.3;128 帧相对方向题正向 91.5%、背向只有 8.3%,训练用的 VSI-590K 正向模板泄漏很明显。

对照实验多数在三任务协议上做,完整七任务只报了最终模型。LUFFY-style 教师轨迹注入平均只有 54.7,跟踪掉到 50.0,往组里塞更好的样本对接口很敏感,解耦不是可有可无的实现细节。

术语

原文与代码

相关论文

全部论文解读