Ego2Act 基准发布:6 个 SOTA 视频模型仅完成 67.8% 任务

MBZUAI、UNC 等机构发布 Ego2Act,这是首个面向目标导向自我中心视频生成的操作基准,共包含 110 个真实任务。给定起始场景与目标,要求模型生成完成任务的第一视角多步执行过程,将视频生成评估从“画面是否合理”推进到“能否执行动作达成目标”。测试覆盖 6 个 SOTA 视频模型,表现最强者也仅完成 67.8% 的任务,显示现有模型在长程目标执行方面仍有明显差距。

2026-10-05 ~ 2026-10-05 · 2 条相关