Ambient 将长视频感知蒸馏进 2B 模型,夺冠自我中心长视频问答
ambient-intelligence-labs · hf · 2026-09-14
- Ambient 团队在 EgoLongQA 2026 上用 sub-2B 参数的视觉语言模型拿下长自我中心视频问答第一名。
- 模型由一个工具调用 agent 蒸馏而来。
- 为满足参数限制,团队通过裁剪多语言 embedding 表来压缩体积,实现小模型的长视频感知能力。
「多模态」频道最新
- Reddit 用户实测 MiniMax 6 步基础流与 4 步加速 LoRA 工作流对比 — Oni8932 · 2026-09-15
- 免 Python 环境:Radiant Canvas 用 MLX 在 Mac 本地跑 Krea 2/FLUX/Qwen — toxicdog · 2026-09-15
- OracleZoom 逐层自写提示词,实现照片 256 倍变焦超分辨率 — multimodalart · 2026-09-14
- 生成 847 条素材花 4500 美元,作者用 Seedance 拍出 22 分钟 AI 动画片 — DavidmComfort · 2026-09-14
- 「史密斯船长拯救泰坦尼克」:AI 视频的荒诞历史改写 — FallingKnifeFilms · 2026-09-14
- 实测 MiniMax 图像一致性:多图分开喂 vs 参考图集差异超预期 — vuse2121 · 2026-09-14