NVIDIA AVO harness 把 Opus 5 的 ARC-AGI-3 成绩从 30% 拉到 100%
daniel_mac8 · x · 2026-08-22
NVIDIA 用其 agent harness AVO + Opus 5 解掉了 ARC-AGI-3 公开基准,把 Opus 5 相对标准 harness 的 30% 成绩提到 100%。作者总结这套 harness 暴露 LLM 潜在能力的关键设计:
- 跨上下文窗口的持久记忆
- 检查 → 规划 → 实现 → 评估的循环
- 推理时利用执行反馈从错误中学习
- supervisor 检测停滞轨迹并让 agent 改道
- 对话 transcript 的外部状态化(工具调用、执行产物、agent 轨迹)
作者的观点:前沿 harness 工程不需要在前沿实验室也能参与——harness 的进步不必动模型权重,却能决定性拉开差距。
所属事件:NVIDIA 编码智能体 AVO 满分通关 ARC-AGI-3(12 条相关)→
「编程与Agent」频道最新
- Agent 编程黑科技:用多实例协作优化 UI — doodlestein · 2026-08-22
- xAI 发布 Grok Bot:可登录工具、像同事一样干活的 AI 队友 — tetsuoai · 2026-08-22
- 开发者吐槽:闭源模型隐藏思维链害苦了 Agent — johnnyApplePRNG · 2026-08-22
- Agent 分三层:业务逻辑、循环框架、生产级基础设施 — blaizedsouza · 2026-08-22
- Every Agent 获计算机控制能力,实测 Token 消耗过高 — every · 2026-08-22
- Grok Build 1.0.8 发布:子智能体并发启动提速不再卡死主会话 — kevinnbass · 2026-08-22