DynaTokens: Controlling Token Dynamics for Continual Video-Language Understanding
Toan Nguyen, Yang Liu, Celso De Melo, Flora D. Salim
EMNLP 2026 Main Conference
cs.CV, cs.LG
2026-03-02
DynaTokens 用固定大小的 Transformer 超网络从紧凑任务码按需生成微调 token,不必随任务增长存储 prompt。NExT-QA 上平均准确率 64.11、遗忘 4.76,优于最强基线 Bisecle 的 62.37 与 5.34。
持续学习里的 VideoQA 卡在一对矛盾上。新任务一来就微调,旧任务的答案会被冲掉,这是 catastrophic forgetting。给每个任务单独存一套 prompt 或 adapter,知识能保住,但任务一多,存储和路由一起膨胀。ProgPrompt 在 NExT-QA 上的峰值显存会从 21.16 GB 涨到 25.43 GB。把 prompt 参数在任务之间共享,不同任务的梯度又会互相打架。
VideoQA 比静态图文问答更陡。同一段视频要覆盖因果、时序、描述类问题,分布漂移更大。现有 parameter-efficient adaptation(PEA,只训少量附加参数)多数在图像-文本流上验证。搬到冻结的 LLaMA-2-7B 加 CLIP ViT-L/14 做流式 VideoQA,仍然缺一个「任务变多、每任务内存几乎不涨、旧任务不掉点」的方案。
DynaTokens 把 prompt 从存下来改成现场算出来。每个任务只留两样小东西:一段生成用的任务码 z^t,和一把检索用的 key k^t。真正喂进 LLM 各层的 adapter prompt,由一个共享的 Transformer 超网络 Hφ 按需合成。超网络权重跨任务复用,体积不随任务序列变长。
生成按层条件化。任务码拆成共享不变部分 zinv 和任务专属部分 zsp,再加一层可学习的层嵌入,让浅层和深层拿到不同的 prompt。以 LLaMA-2-7B、每层 10 个 prompt token、32 层为例,物化后的 prompt 张量大约 1.3×10^6 个数;每个任务实际只存约 6.7×10^3 个数,大约 26 KB,相对物化 prompt 压缩约 200 倍。
路由故意做成无梯度。视频和问题的冻结预训练 embedding 做池化,再经固定的 Rademacher 随机投影得到 key。测试时对 query 做同样处理,按余弦相似度取最近任务码,不需要任务 ID。路由器没有可训练参数,也就不会自己漂。
防遗忘靠 look-ahead regularisation(LA-Reg)。先在当前任务上走几步内循环,看更新后的生成器会对旧任务码吐出怎样的 prompt,再惩罚它和更新前快照的差距。这只需要存码,不回放旧视频。论文把这项目标连到 sharpness-aware minimisation:惩罚的是沿着当前任务梯度走、会把旧 prompt 推歪的锐方向。共享码还有一项二次锚定。另外加了两个辅助目标:用视频和答案预测问题(权重 1.0),用问题和答案预测视频(权重 0.1)。后者是反因果的,只当弱的视觉接地信号。
骨干一律冻结 LLaMA-2-7B 加 CLIP ViT-L/14,adapter 走 LLaMA-Adapter 的 32 层。NExT-QA 按问题类型切成 8 个任务,DramaQA 按 What→Who→Where→How→Why 切成 5 个。指标是平均准确率 Acc(序列结束后各任务 top-1 均值)和平均遗忘 Fog(各任务从峰值掉到最终值的均值)。
| 方法 | NExT-QA Acc / Fog | DramaQA Acc / Fog |
| LLaMA-Adapter | 46.58 / 13.83 | 60.99 / 24.39 |
| ProgPrompt | 53.95 / 10.69 | 67.92 / 14.95 |
| ColPro | 55.14 / 7.43 | 71.24 / 12.64 |
| Bisecle | 62.37 / 5.34 | 71.49 / 10.37 |
| DynaTokens | 64.11 / 4.76 | 72.52 / 9.76 |
相对此前最强的 Bisecle,NExT-QA 准确率 +1.74、遗忘 −0.58;DramaQA 准确率 +1.03、遗忘 −0.61。把两个基准串成 13 任务的领域增量流(真实视频再接影视剧),DynaTokens 平均 Acc 61.96、Fog 11.72,Bisecle 是 55.31 / 13.30。零样本互测:在 NExT-QA 上训、DramaQA 上测,DynaTokens 52.83 对 Bisecle 的 49.07;反过来是 36.29 对 27.86。
消融里 LA-Reg 是主引擎。三项全关只有 21.28 Acc / 16.46 Fog;只开 LA-Reg 就到 62.12 / 5.46。辅助损失再加约 1.67 Acc。look-ahead 步数加上去,Acc 从 54.54 走到 62.30、63.92,默认 2 步是 64.11。八任务联合训练上限 68.42,DynaTokens 吃到上限的 93.7%,Bisecle 是 91.2%。
新的 ImageQA→VideoQA 协议先在 Visual7W 上学静态图,再接 NExT-QA。Bisecle 的视频准确率从单独训的 62.37 掉到 58.24(−4.13);DynaTokens 从 64.11 掉到 62.31(−1.80)。负迁移还在,幅度轻了一半以上。
对要在冻结多模态 LLM 上做终身 VideoQA 的人,这是能落地的折中:推理延迟和 Bisecle 几乎一样(49.3 vs 47.7 ms/query),每任务只多存约 26 KB,任务流变长时 prompt 仓库不会跟着涨。测试时不传任务 ID 也能跑。
别当成免费午餐。可训练参数 9.6M,大约是 Bisecle 的 3 倍;NExT-QA 上训练 5.55 小时、峰值显存 103.8 GB,Bisecle 只要 1.48 小时、18.9 GB。把 look-ahead 收到 1 步,训练压到 2.46 小时、82 GB,Acc 仍有 63.92,过 Bisecle 的 62.37。训练贵,推理不贵。数字上这是扎实的渐进改进,没有换范式。
论文自己列了几条。ImageQA 预训练没有带来视频端的净增益,只是负迁移更小。标准切分是问题类型增量,视觉和时序漂移更宽的流还没测。DramaQA 画面高度同质,最近邻路由准确率只有 41.7%;落到下游只比 oracle 低 0.50 Acc,但路由本身并不稳。实验最长 13 个任务,LA-Reg 随存码线性涨,更长地平线还是空白。
另外两处读下来觉得松。骨干停在 LLaMA-2-7B,对现在的视频 LLM 偏旧。ImageQA→VideoQA 里对图像任务放松了 LA-Reg,这个选择性放松帮了跨模态迁移,也说明原正则并不是即插即用。任务顺序换四组,有一组 Bisecle 的 Acc(63.09)略高于 DynaTokens(62.96),优势没有在所有排列上锁死。