DynaTokens 让视频-语言模型按需生成适配 token,免存任务提示

flosalim · x · 2026-09-22

作者 flosalim 宣布其工作 DynaTokens(Controlling Token Dynamics for Continual Video-Language Understanding)被 EMNLP 2026 主会接收。论文针对视频-语言多模态模型持续学习的痛点:传统做法要为每个新任务存一套适配 token/提示,任务增多后迅速累积。DynaTokens 的思路是让模型学会在需要时自己生成对应的适配 token,而非逐任务存储。实现上基于冻结的 LLaMA-2-7B 骨干加 CLIP ViT-L/14,用 LLaMA-Adapter 做高效视频-语言适配,不微调骨干。

所属事件:DynaTokens 入选 EMNLP 2026,助视频语言模型持续适配(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →