专题 · FULL STORY

NVIDIA AVO:ARC-AGI-3 刷榜背后

8 月 21 日 NVIDIA 发布通用编码智能体 AVO,在 ARC-AGI-3 交互式推理基准公开集上取得惊人成绩引发热议,随后其架构细节曝光:通过持久记忆、监督与工具使用实现长周期自主任务运行,让 Claude 在该基准中拿到满分。

2026-08-21 ~ 2026-08-24 · 2 集 · 24 条

第 1 集 · NVIDIA AVO 智能体刷爆 ARC-AGI-3 公开集(2026-08-21,22 条)

8 月 21 日,NVIDIA 发布通用编码智能体 AVO(Agentic Variation Operators),在 ARC-AGI-3 交互式推理基准的公开集上取得 100% 成绩,完成全部 25 个公开环境中的 183 个关卡,RHAE 达 100.00。该基准不提供任何说明、显式规则或目标提示,AVO 需自行推断任务目标并解决。由于方案未开源、成本未披露,且同一底层模型在不同 harness 下成绩差异巨大,其含金量在社区中引发讨论。

已确认

  • AVO 在 ARC-AGI-3 公开集上取得 100% 得分,完成 25 个环境共 183 个关卡,@MagicZhang、@theologi、@NVIDIAAI、@wavefnx 等多方帖子均确认该成绩
  • AVO 全称 Agentic Variation Operators,据 @danielmac8 介绍,其核心思路是用自主编码 Agent 替代传统进化搜索中的固定变异/交叉算子,Agent 循环中会查阅谱系、知识库和执行反馈来提出新方案;架构上整合持久记忆、监督反馈(supervisor 机制,@HaktanSuren 调侃这套 AI 自己反而需要一名「中层管理者」)和工具使用,并将 Claude 等模型能力集成于系统设计中
  • AVO 在没有指令、明确规则或既定目标的情况下成功推断出任务目标并加以解决;@MagicZhang 展示了标注 100% 得分的官方成绩单截图
  • 据 @eigenhector 转述,AVO 并非专为该基准设计,仅凭极少输入和工具、通过查看以文本表示的过往网格即可完成任务
  • 据 @huggingface 转述,AVO 最初是英伟达为优化 CUDA GPU 内核而构建的自研编码工具;Clement Delangue 由此评论称,借助 Agent,我们将从难以运行、优化不佳的模型走向能真正执行复杂任务的系统
  • @danielmac8 评测指出,AVO harness 配合 Claude Opus 5 使用,将 Opus 5 相对标准 harness 的约 30% 成绩提升到 100%;@imjustnewatai 同样转述这一对比(并称 183/183 为 100% RHAE)
  • @mhmazur 指出,社区对「NVIDIA 解决 ARC-AGI-3」的含金量有争议:该成绩主要归功于 AVO 智能体框架(跨上下文持久记忆与 inspection 能力),而非 Opus 5 模型本身
  • 据 @jamestagg 转述,基准作者 François Chollet 评价称,像所有在 ARC-AGI-3 上表现优异的方法一样,该 100% 分数仅涉及演示集(公开集),并不代表已攻克完整基准
  • @danielmac8 补充,AVO 论文暂无开源代码库,发布材料也未提及成本;但其许多概念与 Prime Intellect 的开源项目 Prime Agent(17.6k star,围绕两个核心抽象构建的自我改进型开源编码与研究 agent)相似,可作为可复现的替代方案

尚未确认

  • 帖子间对 AVO 缩写的展开略有出入(@danielmac8 一帖写作 Agentic Voxel Objects),以 NVIDIA 官方帖的 Agentic Variation Operators 为准

为什么重要

  • @NVIDIAAI 强调,AVO 的成绩说明系统设计(智能体架构、记忆与工具集成)的作用可能胜过单纯提升模型能力,为通用智能体研究提供了新方向
  • 同一底层模型(Opus 5)在不同 harness 下成绩从约 30% 跃升至 100%,说明评测框架本身对 LLM 能力衡量影响巨大;但如 Chollet 所提醒,满分仅覆盖公开演示集,不应被解读为彻底解决 ARC-AGI-3
  • 在非专门针对基准调优的前提下取得公开集满分,意味着该系统在开放环境中的自主目标推断与泛化能力值得持续关注;但缺乏开源与成本信息使独立复现受限,开源的 Prime Agent 提供了对照验证路径

还有 2 条相关讨论 →

第 2 集 · NVIDIA AVO 架构让 Claude 在 ARC-AGI-3 拿满分(2026-08-24,2 条)

NVIDIA 发布 AVO(Agentic Variation Operators)智能体架构,通过集成持久记忆、监督和工具使用,实现长周期自主任务运行。该框架包裹前沿模型后效果显著:Anthropic Claude Opus 5 单独在 ARC-AGI-3 上表现有限,而借助 AVO 框架则获得满分。在 GPU 内核优化等任务中同样表现突出,显示系统设计比模型本身能力更能决定上限。