苹果研究团队发布长视频摘要基准 LVSum
Apple ML Research · rss · 2026-07-20
- Apple ML Research 发布了 LVSum,一个面向时间戳感知长视频摘要的基准。
- 这个基准主要针对多模态大模型在长视频场景中的核心问题:摘要不仅要语义正确,还要在时间上对齐。
- LVSum 收录了 72 个来自 13 个领域的视频,平均时长约 16 分钟。
- 每段视频都由人工标注,最多提供 10 条带有时间引用的摘要,用于更细粒度的时间一致性评测。
「多模态」频道最新
- Reddit 用户求 20GB 显存内的 ComfyUI 成人向工作流 — hobbyist2020 · 2026-07-22
- Krea 2 用户推荐双段 Clownshark 采样配置提升细节 — listopalafoto · 2026-07-22
- Gemini Omni Flash 把船舱直接改成了洞穴风格 — chrisfirst · 2026-07-22
- 用 Gemini、Grok 或 GPT Image 把照片转成提示词 — harshitagu72595 · 2026-07-22
- 有人想训练一个一致性 LoRA,让动漫场景保持统一 — ThirdWorldBoy21 · 2026-07-22
- 手绘手办丢进 Seedance,效果像真的“活过来” — cocktailpeanut · 2026-07-22