看完教程再答下一步,Gemini-2.5-Pro视频演示准确率仅36.2%

Demo-ICL: In-Context Learning for Procedural Video Knowledge Acquisition

Yuhao Dong, Shulin Tian, Shuai Liu, Shuangrui Ding, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Jiaqi Wang, Ziwei Liu

cs.CV

2026-02-09

NTU与上海AI Lab从HowTo100M做成1200题Demo-ICL-Bench,考模型能否从文本或视频演示里学会下一步。开源7B看视频演示几乎不涨分;他们的Demo-ICL把文本演示准确率从基座31.4%拉到43.4%。

这篇在解决什么

现有视频理解基准大多在考两件事:模型脑子里已经有的常识,或者目标视频画面上直接看得见的事实。「打蛋器是什么」和「打蛋器在哪」都能答,并不等于看过一份墨西哥米饭教程,就能在另一段厨房视频里判断下一步该放番茄还是洋葱。

机器人从示范里学新技能,人边看教程边对照手头的活,都更接近后一种。NTU S-Lab 和上海 AI Lab 把这条能力单独拎出来,做成 Demo-driven Video In-Context Learning:当场从文本或视频演示里学会一套流程,再迁移到目标视频上答题。

方法

评测面拆成三档,难度递增。文本演示 ICL 给步骤说明书;视频演示 ICL 给一段同类教学视频;演示选择则先从候选池里找出对的示范,再拿它答题,模拟检索不到完美对齐视频的真实场景。

Demo-ICL-Bench 建在 HowTo100M 上,ASR 用 HTM-AA 的 WhisperX 时间戳。文本演示走粗到细:Qwen2.5-72B 把字幕收成步骤,再由 Qwen2.5-VL-72B 对着对应片段改写,保证步骤和画面能对上。视频配对先用 YouTube 搜索排名和标题相似度收候选,再用两边生成的步骤文本交叉核对。题目卡在中间步骤(头尾不用),文本设定还要求流程不少于 6 步,问的是「下一步做什么」。人工筛完后,三档各留 500/500/200,一共 1200 题。文本演示题人工抽查通过率 96%;演示选择里,人能有把握挑对示范的比例是 88%。

他们训的 Demo-ICL 基于 Ola-Video(OryxViT + Qwen2.5),两阶段。先做视频监督微调,数据来自 LLaVA-OneVision、LLaVA-Video、Oryx、Ola,再加 COIN、Cross-Task 这类流程视频,并掺入与基准不重叠的演示 ICL 样本。第二阶段是 information-assisted DPO:构造 chosen 回答时给模型额外特权信息(文本演示加时间戳,视频演示配上对应文字步骤),普通回答当 rejected,再迭代几轮。训练用 64 张 A100,batch 256,SFT 学习率 1e-5,DPO 5e-7,DPO 样本 5000 条。评测统一采 32 帧,不给字幕。

结果

Demo-ICL-Bench 上,人的平均准确率 80.1%。Gemini-2.5-Pro 掉到 38.9%(文本演示 54.4,视频演示 36.2,演示选择 26.0),GPT-4o 34.9%。开源 7B 更弱,而且视频演示经常帮倒忙。

模型文本演示视频演示 ΔICL平均
Human84.0无对照80.1
Gemini-2.5-Pro54.4未报无演示对照38.9
Qwen2.5-VL-72B45.0(+20.8)+0.429.5
Ola-Video 7B 基座31.4(+8.6)-1.024.8
Demo-ICL 7B43.4(+14.0)+4.433.1

规模对文本演示很灵:72B 无演示时并不比 7B 强,给文本后能涨 20.8 分。视频演示几乎吃不到这个红利。Demo-ICL 的 7B 平均 33.1,超过 Qwen2.5-VL-72B 的 29.5,主要赢在视频演示(32.0 对 25.6)和演示选择(24.0 对 18.0);文本演示 43.4 仍低于 72B 的 45.0,更低于 Gemini。

通用视频理解没有被换掉。VideoMMMU 从基座 46.2 到 52.6,超过 Qwen2.5-VL-7B 的 47.4。Video-MMLU 总分 45.7,Quiz 轨 50.4,对照 Qwen2.5-VL-7B 的 37.5 / 32.9。VideoMME 无字幕 65.2,和同尺寸模型一个量级。

消融把难点钉死了。视频演示从 32 帧加到 128 帧只从 29.4 到 30.4。把参考视频换成目标视频自己(等于直接看完全程)跳到 38.6;只给下一步片段是 35.8;改成 ASR 加字幕到 45.4。看懂画面容易,把另一段视频里的流程抽象出来再迁移很难。训练侧:去掉流程视频 SFT 平均 26.4,SFT 29.8,普通 DPO 30.7,特权信息 DPO 一轮 31.7,完整迭代 33.1。

为什么重要

这条工作把「视频 MLLM 会不会当场学」从零样本问答里拆出来,给了一个可复现的考场。结论对做机器人示范学习和教学视频助手的人更有用:文本说明书现在勉强能用,视频示范还远不能当教材。7B 靠数据配方和 DPO 就能在开源圈里超过 72B 的平均分,说明这项能力对训练信号很敏感,不是单纯堆参数。

它还谈不上能用。33.1 对 Gemini 38.9、对人 80.1,视频演示仍是瓶颈。如果你的产品假设模型看完一段教程就能在新场景里执行,这篇给出的是反例,不是配方。

局限与存疑

作者自己写了两点:没有为演示 ICL 设计专门结构,只改训练;也没有测文本加视频同时作为混合上下文,那种更接近人边看教程边对照说明书的方式。

另有几处论文没充分压实。chosen 回答是靠测试时拿不到的特权信息造出来的,DPO 学到的可能是「有线索时怎么写」,不完全是「从演示里怎么抽象」。演示选择里,Qwen2.5-VL 就算挑对了示范,最终准确率只有 22.2%,还低于直接给对视频时的 25.4%,多余候选会把注意力打散。题目由 LLM 生成,文本演示仍有约 4% 没过人工质检。数据域基本是 HowTo100M 的生活流程,课堂讲授、实验操作、工业装配会不会一样难,没有答案。摘要里 Gemini 文本/视频准确率写成 46.6% 和 32.0%,和表 1 的 54.4 / 36.2 对不上,应以表为准。

术语

原文与代码

社区讨论

相关论文

全部论文解读