美团 MineExplorer 评测:顶级多模态模型在长程探索里集体失手
美团技术团队 · wechat · 2026-07-23
MineExplorer:多模态模型在开放世界里长程探索失手
美团 LongCat 团队提出了 MineExplorer,一个面向 Minecraft 式动态开放世界的多模态评测基准,不再只测静态截图问答,而是测模型在实时变化环境里的连续探索与规划能力。
- 基准包含 813 个人工验证任务,覆盖 1-hop 到 4-hop 的隐藏前置条件任务。
- 每个任务在沙盒中持续运行约 3 分钟,配套规则化里程碑评测框架。
- 论文同时开源了多智能体数据合成流程,可自动生成训练任务。
- 设计目标是测“通用探索能力”,而不是让模型背 Minecraft 专有知识。
他们评测了 18 个顶级模型。结果显示,最强的 Claude-Opus-4.6 总体成功率也只有 41%。
关键结论
- 隐藏前置条件越多,性能掉得越快:1-hop 还能到 77%,4-hop 直接跌到 12%。
- 模型在感知上明显强于推理,瓶颈不是“看不见”,而是“看懂了也串不起来”。
- 最大失败来源是导航,占比接近 60%。
- 增加步数或记忆并不能根治问题,过期观察还可能干扰当前判断。
这项工作想说明的核心是:当前多模态模型已经能“看见世界”,但离“持续探索世界”还有明显鸿沟。
「多模态」频道最新
- 开源节点式 LoRA 训练器把打标、续训和显存监控放进一张图 — ashishsanu · 2026-07-23
- TERRA-129 作为 AI 动画科幻短片亮相,署名 Matygoo — Matygoo1 · 2026-07-23
- GPT Image 2 提示词主打角色身份与服装一致性 — eyishazyer · 2026-07-23
- 阿里发布 Qwen-Audio-3.0-TTS,支持 16 语言与 3 分钟单次生成 — Alibaba_Qwen · 2026-07-23
- 有人认为 Kling AI 的近景表情更自然 — burny_tech · 2026-07-23
- FameGrid Krea 2 试图生成更像真人发布的社媒图片 — UltraMuseArt · 2026-07-23