阿里发布 HappyWorld-Bench:1138 项视频用例测世界模型可靠性
alibabagroup · hf · 2026-09-24
阿里巴巴在 Hugging Face 发布 HappyWorld-Bench,一个评估世界模型的综合基准,强调不仅要看生成质量,还要看 agent 交互下的状态一致性与响应正确性。
- 框架:六个层级世界能力(W1-W6),覆盖视频、空间、具身三条独立评测轨道。
- 规模:1138 个视频提示、300 个空间场景、254 个具身测试用例;配套 HappyWorld-Arena 组织人类 A/B 对比并得出模型级 Elo 分,辅以自动化行为正确性指标。
- 评测对象:14 个视频世界模型、9 个空间系统、8 个具身候选模型。
- 发现:三条轨道均有可靠性缺口——视频模型在长时 rollout 与重访时一致性下降;空间模型放置准确率最高 70.14%、编辑执行 73.33%;具身模型难以在多步动作间保持状态,对动作条件和物理规则变化响应不准。
「研究」频道最新
- 同一提示词 GPT-3.5 全说漏,GPT-4 却 30/30 返回空响应 — rayanpal_ · 2026-09-24
- Amazon 论文:高斯过程智能分配重排预算,RAG 检索质量提升 5.4 nCG@100 — _reachsumit · 2026-09-24
- 论文:LLM 重排被检索召回封顶,实测打不过简单协同过滤基线 — _reachsumit · 2026-09-24
- 超越单一标量:分发式服务接口让多个任务头复用观看时长分布 — _reachsumit · 2026-09-24
- Meta 实测 Muse Realtime Avatar:盲测偏好胜两大商用数字人系统 — AIatMeta · 2026-09-24
- LLM 荐股评分近于抛硬币,开发者用股价当标签重做新闻筛选器 — Fun_Water2230 · 2026-09-24