何恺明团队提出VISTA:视觉原生Harness让模型回看画面,ARC-AGI-3满分

量子位 · wechat · 2026-10-09

何恺明团队在论文《VISTA: A Visual Harness for Reasoning in an Interactive World》中提出视觉原生 Harness,让现有多模态模型直接观察环境、无损保存原始画面,并在推理时随时回看、放大、检查细节,无需从头训练。相比把环境抽象成文字或代码,VISTA 保留原始视觉信息,模型可按当前问题把过去画面重新调入上下文,形成围绕视觉记忆的原生脚手架。

VISTA 由三个组件构成:视觉观测(把 ARC-AGI-3 的 64×64 画面放大为 512×512 PNG)、无损视觉记忆(按回合号和帧号索引保存所有画面,含动画中间帧)、主动视觉检查(inspect 工具可调取历史回合、裁剪放大、多帧对比)。执行流程为观察—假设—按需取证—预测变化—执行—对比修正,并配 GUIDE.md(跨关卡复用规则)与 WORKING.md(当前关卡状态)两份文字笔记,上下文接近上限时先整理交接摘要再续跑。默认每次只向模型展示最后一帧,中间帧存档案按需调取,避免历史图片挤占上下文。

评测上,搭配 VISTA,Claude Opus 5.0 通关 ARC-AGI-3 全部 25 个公开游戏,相对人类动作效率得分满分 100,所用动作数比首次游玩的人类基线少 57.4%;GPT-5.6 Sol 同样全通关,得分 99。GameWorld 170 项任务成功率从 40.0% 升至 63.3%;AIGameStore 综合得分从 47.3 升至 140.3(人类中位数归一为 100);BabyVision 39 道迷宫与连线题准确率从 41.0% 升至 63.2%。作者为 Qiushi Han、胡珂雅、Linlu Qiu、Cathy Wu 与何恺明,未来方向指向具身任务。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →