英伟达AVO智能体拿下ARC-AGI-3满分,靠外壳而非模型
新智元 · wechat · 2026-08-22
英伟达通用编码智能体 AVO 在 ARC-AGI-3 上取得满分:通关 25 个游戏环境的全部 183 关,仅用 6624 步,RHAE 达 100.00。ARC-AGI-3 不给规则与目标,模型需自己探索;其底层模型是 Claude Opus 5——单独应考仅 30.16%(已是官方榜第一),套上 AVO 外壳后直接跳到满分,全程只用 64×64 纯文本网格,不含任何图像 token。
起作用的机制有两点:持久记忆——把历史版本、评测结果、profiler 输出、累积推理全部存下来,上下文重置后从当前状态续干而非从零重来;监督器——不干活,只盯着搜索轨迹,发现停滞或原地打转就把主智能体拽向别的策略。
AVO 本为 GPU 算子优化而生:把变异算子换成自主智能体,能查 CUDA/PTX 文档、跑测试、读 profiler、自我诊断。在 B200 上自主运行 7 天、探索 500+ 方向后,其多头注意力内核比 cuDNN 快最多 3.5%、比 FlashAttention-4 快最多 10.5%;GQA 内核约 30 分钟即比两者快 7.0%/9.3%。团队为华人班底:共同一作许冰(MXNet 作者、GAN 原始论文作者之一)、陈天奇、叶子豪等。
这是六周内第三个 ARC-AGI-3 满分(Tycho、VISTA 在前),且三家都用 Claude Opus 5 驱动。英伟达的逻辑:模型开源免费(Nemotron4)、harness 这一层它占得住,而长时程智能体恰是最吃 GPU 的负载。
所属事件:NVIDIA AVO 智能体刷爆 ARC-AGI-3 公开集(22 条相关)→
「编程与Agent」频道最新
- OpenAI 展示用语音在 Codex 实现免手写代码 — OpenAIDevs · 2026-08-24
- Swarms:企业级多智能体编排框架开源 — KyeGomezB · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24
- Claude 自主验证 43 个数学模块,AI 攻克理论物理难题 — Tkaraletsos · 2026-08-24
- Compound Engineering 插件重写:上下文体积缩减 70% — iamrobotbear · 2026-08-24
- Lighter 证明器挑战突破 10 万 TPS,两周提升超十倍 — econoar · 2026-08-24