DynaTokens 让视频-语言模型按需生成适配 token,免存任务提示
flosalim · x · 2026-09-22
作者 flosalim 宣布其工作 DynaTokens(Controlling Token Dynamics for Continual Video-Language Understanding)被 EMNLP 2026 主会接收。论文针对视频-语言多模态模型持续学习的痛点:传统做法要为每个新任务存一套适配 token/提示,任务增多后迅速累积。DynaTokens 的思路是让模型学会在需要时自己生成对应的适配 token,而非逐任务存储。实现上基于冻结的 LLaMA-2-7B 骨干加 CLIP ViT-L/14,用 LLaMA-Adapter 做高效视频-语言适配,不微调骨干。
所属事件:DynaTokens 入选 EMNLP 2026,助视频语言模型持续适配(2 条相关)→
「多模态」频道最新
- MiniMax H3 上跑 M5 Ultra 实测:768p 视频约 2 分 22 秒生成 — bakawolf123 · 2026-09-22
- 创作者免费公开全部 AI 提示词,按场景整理在 Milanote 画布上 — gen_ericai · 2026-09-22
- 开源 Agent Skill 一键生成圆润 IP 吉祥物 logo,已揽 5.4k 星 — tom_doerr · 2026-09-22
- 学生党求多镜头角色一致性视频工作流:Krea+H3+ComfyUI 可行吗 — NewPhoneWhotiz · 2026-09-22
- Qwen 2.1 实测:CFG 1.0 + 12 步把出图时间砍半 — FreeTheClanks · 2026-09-22
- Qwen-Image-2.1 登顶开源文生图 Arena,距 GPT-Image 仅 11 分 — arena · 2026-09-22