英伟达AVO智能体拿下ARC-AGI-3满分,靠外壳而非模型

新智元 · wechat · 2026-08-22

英伟达通用编码智能体 AVO 在 ARC-AGI-3 上取得满分:通关 25 个游戏环境的全部 183 关,仅用 6624 步,RHAE 达 100.00。ARC-AGI-3 不给规则与目标,模型需自己探索;其底层模型是 Claude Opus 5——单独应考仅 30.16%(已是官方榜第一),套上 AVO 外壳后直接跳到满分,全程只用 64×64 纯文本网格,不含任何图像 token。

起作用的机制有两点:持久记忆——把历史版本、评测结果、profiler 输出、累积推理全部存下来,上下文重置后从当前状态续干而非从零重来;监督器——不干活,只盯着搜索轨迹,发现停滞或原地打转就把主智能体拽向别的策略。

AVO 本为 GPU 算子优化而生:把变异算子换成自主智能体,能查 CUDA/PTX 文档、跑测试、读 profiler、自我诊断。在 B200 上自主运行 7 天、探索 500+ 方向后,其多头注意力内核比 cuDNN 快最多 3.5%、比 FlashAttention-4 快最多 10.5%;GQA 内核约 30 分钟即比两者快 7.0%/9.3%。团队为华人班底:共同一作许冰(MXNet 作者、GAN 原始论文作者之一)、陈天奇、叶子豪等。

这是六周内第三个 ARC-AGI-3 满分(Tycho、VISTA 在前),且三家都用 Claude Opus 5 驱动。英伟达的逻辑:模型开源免费(Nemotron4)、harness 这一层它占得住,而长时程智能体恰是最吃 GPU 的负载。

所属事件:NVIDIA AVO 智能体刷爆 ARC-AGI-3 公开集(22 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →