开发者借 DINOv3 与 SAM 3.1 尝试逐帧追踪乐器运动
MaziyarPanahi · x · 2026-10-06
开发者 Maziyar Panahi 感谢 Meta 发布 DINOv3 与 SAM 3.1,并预告下一步尝试:用这套视觉模型组合逐帧追踪画面中每件乐器的运动轨迹。
DINOv3 负责强泛化的视觉特征提取,SAM 3.1 负责分割,两者组合在视频目标追踪任务上是近期开源生态里颇受关注的搭配。
「多模态」频道最新
- Google 发布 KeyRec:仅用 10% 视觉 token 预算搞定长视频与流式理解 — google · 2026-10-06
- 给 Opus 5.5 配齐 Blender、ElevenLabs 和 REAPER,一周做出电视级广告 — zeeg · 2026-10-06
- Seedance 2.5 实测:古树成群走入迷雾的 30 秒告别 — LudovicCreator · 2026-10-06
- Midjourney 风格码 3896456162 实测:70 年代柯达胶片遇上迪斯科美学 — michaelrabone · 2026-10-06
- 四年前 Google 发布 Phenaki:最早能生成长达数分钟视频的模型之一 — dumierhan · 2026-10-06
- 为不存在的歌做歌词视频:AI 音乐视频又整新活 — Fit-Case1093 · 2026-10-06