ECCV 2026 论文 Gen2Balance:用文生视频填充长尾数据达 SOTA
dimadamen · x · 2026-09-10
Bristol 大学与 Adobe Research 的 ECCV 2026 论文 Gen2Balance,用文本生成视频模型解决长尾视频动作识别的数据不平衡问题,并发布含 223 类、14 万条生成片段的数据集。
方法要点
- 用多模态 LLM 分析真实视频样本,构建动作画像并撰写多样化、类别忠实的提示词,再由文生视频模型生成片段填补少数类。
- 采用两阶段训练策略缓解合成数据的域偏移。
结果
- 在 UCF-101 长尾版(UCF-LT)与时序更难的 Kinetics 子集(K100-LT)上超越最强基线,尾部与少样本动作类别准确率显著提升。
- 尽管合成视频存在物理失真,精心设计的提示词生成的视频已足够可信且类别忠实,足以带来 SOTA 表现。
「多模态」频道最新
- 试玩 10 分钟:AI 生成的 RTS 游戏雏形已可用 — sujingshen · 2026-09-10
- invideo 联手 Sony Liv:AI 生成的原创节目直接上线流媒体 — aziz4ai · 2026-09-10
- 日本创作者用海螺 AI+Suno V6 打造映像作品《廻哀村》释出预告 — Hailuo_AI · 2026-09-10
- ComfyUI 自定义节点包被以安全理由封禁,作者申诉无门 — jjjnnnxxx · 2026-09-10
- 网友用 Krea2+MiniMax 串起 ref2vid 工作流,生成马车场景短片 — StandWorth9165 · 2026-09-10
- 水彩野兽派风格提示词模板:双色纯色营造原始张力 — LudovicCreator · 2026-09-10