何恺明团队提出VISTA:视觉原生Harness让模型回看画面,ARC-AGI-3满分
量子位 · wechat · 2026-10-09
何恺明团队在论文《VISTA: A Visual Harness for Reasoning in an Interactive World》中提出视觉原生 Harness,让现有多模态模型直接观察环境、无损保存原始画面,并在推理时随时回看、放大、检查细节,无需从头训练。相比把环境抽象成文字或代码,VISTA 保留原始视觉信息,模型可按当前问题把过去画面重新调入上下文,形成围绕视觉记忆的原生脚手架。
VISTA 由三个组件构成:视觉观测(把 ARC-AGI-3 的 64×64 画面放大为 512×512 PNG)、无损视觉记忆(按回合号和帧号索引保存所有画面,含动画中间帧)、主动视觉检查(inspect 工具可调取历史回合、裁剪放大、多帧对比)。执行流程为观察—假设—按需取证—预测变化—执行—对比修正,并配 GUIDE.md(跨关卡复用规则)与 WORKING.md(当前关卡状态)两份文字笔记,上下文接近上限时先整理交接摘要再续跑。默认每次只向模型展示最后一帧,中间帧存档案按需调取,避免历史图片挤占上下文。
评测上,搭配 VISTA,Claude Opus 5.0 通关 ARC-AGI-3 全部 25 个公开游戏,相对人类动作效率得分满分 100,所用动作数比首次游玩的人类基线少 57.4%;GPT-5.6 Sol 同样全通关,得分 99。GameWorld 170 项任务成功率从 40.0% 升至 63.3%;AIGameStore 综合得分从 47.3 升至 140.3(人类中位数归一为 100);BabyVision 39 道迷宫与连线题准确率从 41.0% 升至 63.2%。作者为 Qiushi Han、胡珂雅、Linlu Qiu、Cathy Wu 与何恺明,未来方向指向具身任务。
「编程与Agent」频道最新
- 创业公司内部 Devin 已完成九成开发工作,全面接管 Codex 与 Claude Code — RileyRalmuto · 2026-10-10
- 三件套本地方案帮创始人复制自己:月处理 $42k 净利的遗产认领生意 — aryanXmahajan · 2026-10-10
- 一年之变:生成式 UI 从实验长成一套 Web 协议栈 — agihouse_org · 2026-10-10
- 纽约 AI 晚宴纪要:推理优化靠 agent 找、代码审查已不划算 — paulnovosad · 2026-10-10
- 用 Codex 给 SNES 老游戏加 4K CRT 滤镜,《时空之轮》焕新生 — pvncher · 2026-10-10
- AI Agent 迈出新一步:Priors 交易代理可在 Robinhood 以自己名义开户授信 — econoar · 2026-10-10