Ego2Act 基准发布:6 个 SOTA 视频模型仅完成 67.8% 任务
MBZUAI、UNC 等机构发布 Ego2Act,这是首个面向目标导向自我中心视频生成的操作基准,共包含 110 个真实任务。给定起始场景与目标,要求模型生成完成任务的第一视角多步执行过程,将视频生成评估从“画面是否合理”推进到“能否执行动作达成目标”。测试覆盖 6 个 SOTA 视频模型,表现最强者也仅完成 67.8% 的任务,显示现有模型在长程目标执行方面仍有明显差距。
2026-10-05 ~ 2026-10-05 · 2 条相关
- Ego2Act 基准:6 个视频模型跑 110 个真实任务,最强仅完成 67.8% — zmkzmkz · 2026-10-05
- Ego2Act 基准:测 6 个 SOTA 视频模型能否执行多步动作达成目标 — mohitban47 · 2026-10-05