Ego2Act 基准:测 6 个 SOTA 视频模型能否执行多步动作达成目标
mohitban47 · x · 2026-10-05
研究者发布 Ego2Act,一个新的目标导向视频生成基准,把视频生成评估从"未来画面看起来是否合理"推进到"模型能否执行多步动作来达成目标"。
- 给定场景与目标,要求模型生成第一人称视角的任务执行过程,考察视频模型作为世界模拟器的能力。
- 覆盖 110 个真实世界场景,对 6 个 SOTA 视频生成模型进行测试。
- 论文、代码与数据已在项目页、GitHub 和 Hugging Face 公开。
所属事件:Ego2Act 基准发布:6 个 SOTA 视频模型仅完成 67.8% 任务(2 条相关)→
「多模态」频道最新
- AI 生成恶搞视频已难辨真伪,B 站相关内容井喷 — minchoi · 2026-10-06
- Geometry Duo 登陆 ComfyUI:白模+法线引导视频生成的几何稳定性 — Narrow-Particular202 · 2026-10-06
- 不花 API 钱:Edge TTS 并行流式脚本实现逐句实时语音播放 — Speedk4011 · 2026-10-06
- 12GB显卡本地跑MiniMax H3做电影预告片:0.6MP+4:3是甜点 — vortis23 · 2026-10-06
- 网友让Opus 5.5自编自导短片:用Python+Pillow全程序化生成 — danjr000 · 2026-10-05
- 单张 RTX 4090 跑全双工语音助手 Speakrail,部分基准叫板 GPT-Live — danil_rootint · 2026-10-05