MIT 论文旧题重提:SOTA 多模态模型在 BABA 谜题上惨败
moschles · reddit · 2026-10-09
Reddit 用户翻出 2024 年 ICML 会议上一篇 MIT 与 Virginia Tech 研究者的论文《BABA-is-AI》:测试 GPT-4o、Gemini-1.5-Pro/Flash 三个当时最强的多模态大模型,发现当通关需要操纵和组合游戏规则时,模型会「惨烈失败」。配套开源仓库为 GitHub 上的 baba-is-ai,论文编号 arXiv:2407.13729。
作者提出的问题:到今天,万亿参数级模型驱动的 agent 集群已能通过 ARC-AGI-3、FrontierMath 等高难基准,那么这些小型「钥匙-门」谜题是否已被轻松攻克?他个人倾向于认为如今的 agentic swarm 配合适当 harness 即可解出;但若依然失败,这篇论文的重要性反而随时间放大,应推荐给 Francois Chollet 和 ARC 基金会,作为 ARC-AGI-4 的候选基准。
所属事件:两年前 BABA-is-AI 论文重提:SOTA 多模态模型仍惨败(2 条相关)→
「研究」频道最新
- Lancet 前瞻性研究:面向患者的 AI 问诊在急诊场景表现获认可 — EricTopol · 2026-10-09
- COLM 2026 首届 Agent Behavior 研讨会 10 月 9 日旧金山举行 — _Hao_Zhu · 2026-10-09
- Autorubric 附 25 个评测配方:rubric 设计、judge 校准与成本控制全 covered — deliprao · 2026-10-09
- Autorubric 登场 COLM 2026:统一框架解决不可验证任务的 LLM 评测 — deliprao · 2026-10-09
- Google AMIE 登上柳叶刀:首个真实诊所前瞻性研究发布 — ymatias · 2026-10-09
- µ0 世界模型开源数据引擎 TraceExtract:纯视频训练机器人策略 — RexDouglass · 2026-10-09