Ego2Act 基准:6 个视频模型跑 110 个真实任务,最强仅完成 67.8%
zmkzmkz · x · 2026-10-05
MBZUAI、UNC 等机构发布 Ego2Act,首个面向目标导向自我中心视频生成的操作基准:给视频生成模型一个起始场景和一个目标,考察它能否生成完成任务的第一视角执行过程。
- 团队录制 110 个真实日常操作任务,评测 6 个 SoTA 视频模型,从单一起始帧开始生成
- 最强的 Seedance-2.0 也仅完成 67.8% 的任务,人类评分下 Final 得分 64.0
- 88.7% 的失败步骤源于模型跳过某步或只部分执行,导致后续步骤缺少依赖状态
- 配套的 Ego2ActJudge 无参考自动评分器与人类评分相关性达 r=0.69,优于现有评测器
该基准可用于衡量视频模型作为具身规划世界模拟器的能力。
「多模态」频道最新
- 研究者把新歌做成 AI 音乐游戏:手绘小车+Stable Audio 音效 — jordiponsdotme · 2026-10-05
- Gnani AI 用 1400 万小时电话音频训练语音模型,21+ 语言 TTS 延迟低于 200ms — CurieuxExplorer · 2026-10-05
- Eloelo 发布 Dolphin AI:剧本一键转多镜头长视频,角色声音服装全连贯 — CurieuxExplorer · 2026-10-05
- HeyGen Video 1 上架 OpenRouter:盲测对标顶级视频模型,价格仅零头 — toolstelegraph · 2026-10-05
- 腾讯提出 RMD 蒸馏法,破解长时序自回归视频生成的误差累积 — tencent · 2026-10-05
- 73 个 Fable 5.5 作品全开源,混剪展示单 prompt 成片能力 — yihui_indie · 2026-10-05