34 个大模型考文字冒险游戏:合成局近满分,人写的局最强过不了 15%

TALES: Text Adventure Learning Environment Suite

Christopher Zhang Cui, Xingdi Yuan, Ziang Xiao, Prithviraj Ammanabrolu, Marc-Alexandre Côté

cs.AI, cs.CL

2025-04-19

微软联合 UCSD 把 5 套文字冒险游戏统一成 TALES 评测。34 个大模型 zero-shot 上场,合成局能刷近满分,人写的游戏最强也过不了 15%。

这篇在解决什么

判断一个大模型「能不能推理」,单选题式的 benchmark 已经不够用了。真正考验模型的是一连串互相依赖的决策:先去厨房、再拿锅、点火、放食材,每一步都建立在上一步的观测之上,错了要能自己纠回来。文字冒险游戏天然就是这种场景,纯文本输入输出、状态隐藏、需要长程规划,几十年来一直是测 agent 的经典考场。

问题在于,这个考场的试卷是散的。TextWorld、ALFWorld、ScienceWorld、Jericho 各自一套,每套评测时给 agent 塞的「脚手架」也不一样:有的直接给动作模板,有的注入专家知识。脚手架一多,分数就被撑起来,测的到底是模型自己会推理,还是会照着提示走,就分不清了。TALES 想做的事,是把这些试卷统一到同一套「最少提示」的规矩下,让模型裸考。

方法

TALES 把五个文字冒险游戏框架原样收进来,一共 122 个游戏:TextWorld(10 个按难度递增的烹饪局)、TextWorldExpress(16 个,TextWorld 的加速重写版)、ALFWorld(12 个家务任务)、ScienceWorld(30 个小学科学实验)、Jericho(54 个人类作者写的互动小说,如 Zork)。前四个是程序生成的合成游戏,Jericho 是为人玩而设计的。

核心设计是一个叫 Simon Says 的「单元测试」。最简单的版本让 agent 复述一条指令;进阶版 Simon Says With Memory 在开局直接把整条通关步骤喂给模型,每做对一步得一分,顺序错或做错就整局重来。这题听起来幼稚,但它在测一件最基本的事:模型能不能在长程任务里老老实实按指令走。作者发现 Simon Says 的成绩和模型在整套 TALES 里的表现高度相关,皮尔逊相关系数达到 0.83。于是他们设了一道门槛,只有能在 100 步版 Simon Says With Memory 上拿到 90% 以上的模型,才进入正式评测。34 个模型里只有 9 个过门。

agent 本身是 zero-shot 的,系统提示极简:你在玩一个文字游戏,每回合回一句短动作,卡住就敲 help,不告诉它任何环境特定的专家知识。这个「裸考」设定是刻意的——去掉动作模板和提示注入,分数反映的才是模型自身的推理。每局封顶 100 步,受算力和预算所限,这个步数上限意味着 Jericho 最多只能拿到满分的 57%。

结果

九个过门模型里,推理模型 Claude-3.7-Sonnet 以平均 52.5 分领跑整体,zero-shot 里最强的是 Claude-3.5-Sonnet(50.4),其后是 gemini-2.5-pro-preview(49.3)、o1(44.2)、gpt-4o(40.6)。

合成游戏和人写的游戏之间有一道明显的断层。同一批模型,在 TextWorld 上 Claude-3.7 能拿 97.3 分,到 Jericho 只剩 12.5;gpt-4o 从 83.6 掉到 5.6。

模型TextWorldALFWorldScienceWorldJericho
Claude-3.7-Sonnet97.383.376.512.5
gpt-4o83.656.761.45.6

Jericho 是为人娱乐设计的真人写作游戏,也是模型集体翻车的地方:最强的 agent 在这一类游戏上平均也过不了 15%。即便是其中最著名的 Zork1,作者从 Claude-3.7 的思维链里反复看到 Zork 的内容,强烈怀疑它进了训练数据,也没有任何一个模型能在 100 步内拿到可达分数的一半。作者的结论很直白:参数化记忆补不上推理的缺。

代价也不低。推理模型跑一个 Jericho 游戏要烧掉几千万 token,DeepSeek-R1 用得最多。

为什么重要

对做 agent 的人来说,TALES 是一面比较诚实的镜子。在带脚手架的合成 benchmark 上刷到接近满分,不等于模型真能在长程、少提示、人设计的任务里独立推理。这篇用数据把这点钉死了:同一批模型从合成局到 Jericho 断崖式下跌,断在「接地推理」和「归纳推理」上。

Simon Says 这道门槛也有实用价值。它便宜、可复现,和整体成绩相关性高达 0.83,适合当快速预筛:一个连「照着通关步骤走」都做不到的模型,没必要花大钱跑完整套 122 个游戏。

局限与存疑

100 步的封顶是硬伤。Jericho 最多只能拿到满分的 57%,所以「过不了 15%」多少被步数上限压着;作者承认是算力和预算逼的,跑不到自然结束。

「最少脚手架」本身是个设计选择,不是中性的。别的 benchmark 给 agent 动作模板、注入专家知识是有道理的,TALES 一刀切掉,对那些本来就靠脚手架吃饭的方法不太公平,横向对比时要心里有数。

几个模型只跑了一个 seed(gemini-2.5-pro-preview、gemini-2.0-flash),方差没控住。数据污染也没法彻底排除:Zork 这类经典作很可能在训练集里,作者只能靠思维链里的引用去「强烈怀疑」,没法定量。

最关键的一点:作者只深扒了 Claude-3.7-Sonnet 一个推理模型的思维链,关于接地与归纳推理先崩、思维链前后矛盾的结论,是从这一个模型上读出来的,外推到所有推理模型要谨慎。而且他们每步都把思维链丢掉重来、没用扩展思考,「思维链前后矛盾」有一部分可能是这个设置造成的,不全是模型本身的问题。

术语

原文与代码

社区讨论

相关论文

全部论文解读