MNIST-PRO: MNIST is Back as a Partially Observable World for AI Agents
Vernon Toh, Navonil Majumder, Zhengyuan Liu, Nancy F. Chen, Soujanya Poria
cs.AI, cs.CV
2026-09-01
NTU把MNIST改成64×64窥视窗口搜索基准:模型全图识别可达99%,部分可观测后Gemini-3.7-Flash从98%掉到65%,把碎片拼成画布才能部分挽回。
多模态模型在MMBench这类基准上已经能看图答题,真实代理面对的是部分可观测世界:一次只能看到一小块,必须自己决定往哪看,再把碎片收成一份能用的感知状态。现有评测要么把完整图像一次喂给模型,要么把感知、导航、碰撞搅在一起,分不清失败出在哪。
MNIST-PRO把经典数字识别改成受控的POMDP。数字本身几乎被做穿了,全图识别准确率在83%到99%。难度全部来自一次只给64×64窗口、必须自己走、还要记得看过什么。
环境把28×28的MNIST放大到224×224并二值化。智能体看到的是一张几乎全灰的画布,只有当前窗口可见。动作是上下左右各走32像素,或直接给出答案。Level 1是单数字,步数上限36;Level 2把两个数字横拼成224×448,上限78,还要保住左右顺序。每档100个episode,Level 1十类各十题。
评测刻意拆开感知状态怎么建。四种内部表示:Image Only保留全部历史窥视(H=∞);Textual State在H=1时只靠自己写下的thought往前传;Metric Grid Map同样H=1,强制维护相对坐标和格子特征;Visual Memory Canvas由环境按坐标把窥视拼成一张图,分在线逐步拼和离线回放拼。再加一套能写代码、拼图的agentic harness,以及跨episode的持久记忆。十个模型,含Gemini、Claude、GPT系列和Qwen-3.8-27B、GLM-4.6V。
原生多轮、历史全留时,Gemini-3.7-Flash的Level 1/2是75.0%/47.0%,对照全图是98.0%/97.0%。Claude-5-Sonnet走得最多(15.96/43.24步),准确率只有23.0%/0.0%。GLM-4.6V平均2.76步就交卷,13.0%/0.0%。
更严的受控设置里,即便H=∞,Gemini-3.1-Pro-Preview从全图99.0%掉到Level 1的38.0%;Gemini-3.7-Flash是65.0%/22.0%。Level 2没有模型超过30%。审计1600条轨迹:323次只报了一个数字,其中238次从未碰到另一个数字的任何像素,平均只用了78步预算里的15步。早期错误数字写进文本状态后,后续反证也改不掉。即便两个数字覆盖都超过75%,完整序列准确率也只有26.0%;覆盖不超过25%时只有1.0%。看见了不等于会读。
离线把同一条轨迹拼成画布,解释瓶颈立刻露出来。Claude-5-Opus的Textual State笔画覆盖已经到83.0%/80.5%,准确率41.0%/13.0%;同样轨迹加上离线画布升到76.0%/67.0%。Claude-5-Fable从38.0%/18.0%升到81.0%/69.0%。Harness里Gemini-3.7-Flash自己拼图,升到88.0%/63.0%,步数大约变成Memory Canvas的2到3倍。持久记忆没有再涨(85.0%/62.0%)。GPT-5.6-Terra发现了用ASCII拼画布的办法,却只在约2%的episode里真正调用。
开源模型更差。GLM-4.6V在文本状态下重访率超过60%,格子地图也只能覆盖画布的46.7%/33.1%。
这篇把「会认数字」和「会在部分可观测世界里建感知状态」拆开了。对做GUI代理、机器人主动感知的人,结论很具体:加长视觉历史、加坐标、给工具,效果因模型而异,没有一种表示通吃。更扎手的是停止策略和信念更新。很多失败不是没看见,是看见了却不会改口,或没看完就交卷。
MNIST本身简单,所以这是诊断工具,不是部署基准。它说明现有VLM的工作记忆和主动感知还很薄,单靠把历史帧塞进上下文解决不了。
画布是干净的二值数字,没有纹理、光照、遮挡。窗口固定64×64、步长32,动作空间只有四向,跟真实相机差很远。每档只有100个episode,统计波动不小。模型名单混了未公开的Gemini、Claude、GPT版本号,复现成本高。持久记忆实验只报了两个模型。离线画布的增益被写成组织和解释问题,但画布也改变了输入格式,不完全是同一表示上的对照。开源模型的循环没有单独拆开是规划差还是指令跟随差。