Baba Is AI: Break the Rules to Beat the Benchmark
Nathan Cloos, Meagan Jens, Michelangelo Naim, Yen-Ling Kuo, Ignacio Cases, Andrei Barbu, Christopher J. Cueva
cs.CL
2024-07-19
MIT 与弗吉尼亚大学把 Baba Is You 做成视觉基准,模型只看一张初始网格就写高层计划,GPT-4o 在单房间前四档满分,改写规则时三个模型平均只有 14.7% 到 20%。
网格任务通常把规则焊在模拟器里,模型只负责在规则里面找路。Baba Is You 把这件事倒过来,规则是可推的文字方块。三个方块水平排成「名词 is 属性」,规则生效;推歪一块,规则失效。谁是玩家、碰到什么算赢、墙挡不挡路,都在格子上。
两件事很少被一起考。一件是从干扰物体和干扰规则里认出正在生效的规则。另一件是把见过的改规则动作拼成没见过的序列。组合泛化常问的是,见过红圆和绿钥匙之后,会不会处理红钥匙。这里绑定关系本身可以被挪走。MIT 和弗吉尼亚大学据此做了简化环境 Baba Is AI,发表在 ICML 2024,用来看多模态模型会不会改规则。
环境建在 Gymnasium 的 Minigrid 上。模型只看初始局面的一张静态图,不在格子里试错,也不输出方向键。计划只有三个原语:break 推散一条生效规则,make 排成一条新规则,goto 走到某个物体。方块不在场上,对应原语就不能用。
生效条件写在提示里:句式必须是「物体 is 属性」,三块必须水平对齐。[baba is you] 是控制白色三角,[door is win] 是走到门上获胜,[wall is stop] 是墙挡住去路。图 1 的解法就是先拆开挡路的墙规则,再把门排成获胜条件,最后站上门。原语用在规则层,是为了不让低层寻路把「没看懂规则」淹没掉。
先给游戏说明,再给 10 组图和获胜计划,每组都要模型写下推理,并先归纳一个通用算法,然后用到新图上。评分是最终输出和标准计划的精确匹配,不把计划放回模拟器跑。每个测试环境取 5 条输出,整个流程重复 5 个随机种子,种子间更换示例和测试图。
模型是 GPT-4o,以及 2024 年 5 月的 Gemini-1.5-Pro 与 Gemini-1.5-Flash。前两个当时在 Chatbot Arena 居前两名,Flash 因性能和价格被一并测了。图像直接输入,不先转写为文字。
单房间只考一件事:走到当前赢规则点名的物体。四档依次是无干扰的新布局、多一个干扰物体、多一个干扰名词、两者都有。GPT-4o 四档满分。Flash 高于 Pro。
第五档才掉。干扰名词自己组成一条已经生效的赢规则,但点到的物体不在场上,例如 [door is win] 而没有门,正确计划是按 [ball is win] 去找球。论文只说准确率明显下降,没给百分比。
两房间沿用同一组干扰,加一堵居中竖墙和 [wall is stop] 的方块。规则初始始终未对齐,墙并不挡路,增加的是干扰负荷。整体平均比单房间更低,没有逐档数字。
规则组合另测。上下文分别给过直接走到物体、先立规则再走、先拆规则再走。测试要求先拆再立再走,例如拆掉 [wall is stop],立起 [ball is win],再走到球。三家都很低。四种模板轮流留出一种做测试,论文说仍然低,并注明结果没有展示。
图 6 三关物体差不多,看起来很像,解法不同。中间一关先拆 [wall is stop],再把墙的名词方块排成 [wall is win],走到墙上。右边一关的 [wall is stop] 挤在角落,推不开,拆不掉,人被关在左房。必须改控制权:拆掉 [baba is you],立起 [key is you],用墙对面的钥匙去立 [door is win],再走到门。
| 模型 | 设置 | 结果 |
| GPT-4o | 单房间前四档 | 满分 |
| 三家模型 | 单房间第五档 | 明显下降,无百分比 |
| Gemini-1.5-Flash | 图 6 均值±标准差 | 20.0 ± 29.28 |
| GPT-4o | 图 6 均值±标准差 | 17.33 ± 28.15 |
| Gemini-1.5-Pro | 图 6 均值±标准差 | 14.67 ± 20.66 |
标准差和均值差不多大。这组百分之十几到二十的成绩,撑不起模型之间的稳定排序。
认一条生效的赢规则、放过普通干扰,和把规则拆开再重写,成绩差得很远。前者 GPT-4o 能满分。后者,包括把「玩家」转给钥匙,三个受测模型平均只有 14.7% 到 20%。Arena 排名对不上:Pro 当时高于 Flash,图 6 上 Flash 为 20.0,Pro 为 14.67。
对做智能体的人,break、make、goto 接近读约束、改约束、再执行。代码随论文公开,可以换新模型重跑。这是诊断,不是一项能直接抬分数的技术。
精确匹配会错杀换了说法的正确计划,也会放过文本碰巧一致、方块其实推不动的计划。论文记录的错误里,有的是提到场上没有的物体,有的是把通畅的路说成被挡住。这两类是定位和路径,不是规则组合。方法里没有文字状态对照,图像没看清和规则没组合对,分数上是同一种错。
两房间更难,是因为失效的墙规则仍占着方块,不是因为要绕路。留一法只有一句「仍然低」。图 6 的标准差有 20 到 29 个点,5 条输出乘 5 个种子,Flash 和 Pro 的差距盖不住波动。规则被简化成水平的「名词 is 属性」。已报告的实验只有这三家模型、一张初始图,没有人类分数,也没有看完一步再改计划的设置。