MIT 论文旧题重提:SOTA 多模态模型在 BABA 谜题上惨败

moschles · reddit · 2026-10-09

Reddit 用户翻出 2024 年 ICML 会议上一篇 MIT 与 Virginia Tech 研究者的论文《BABA-is-AI》:测试 GPT-4o、Gemini-1.5-Pro/Flash 三个当时最强的多模态大模型,发现当通关需要操纵和组合游戏规则时,模型会「惨烈失败」。配套开源仓库为 GitHub 上的 baba-is-ai,论文编号 arXiv:2407.13729。

作者提出的问题:到今天,万亿参数级模型驱动的 agent 集群已能通过 ARC-AGI-3、FrontierMath 等高难基准,那么这些小型「钥匙-门」谜题是否已被轻松攻克?他个人倾向于认为如今的 agentic swarm 配合适当 harness 即可解出;但若依然失败,这篇论文的重要性反而随时间放大,应推荐给 Francois Chollet 和 ARC 基金会,作为 ARC-AGI-4 的候选基准。

所属事件:两年前 BABA-is-AI 论文重提:SOTA 多模态模型仍惨败(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →