ARC-AGI-3成绩飙至96%:给Opus5一台电脑自己造工具
新智元 · wechat · 2026-08-13
开发者 Jeremy Berman 的一项测试引发热议:在 ARC-AGI-3 测试中,通过改变运行环境,Claude Opus 5 的成绩从官方的 30.2% 飙升至 96.2%。
核心突破在于“给模型一台电脑”:测试没有使用精心设计的提示词或专用代码,仅提供一个 Claude Code 环境、动作命令和文件系统日志。Opus 5 在面对陌生游戏关卡时,会自主摸索规则,并现场编写解析器、搜索函数甚至游戏模拟器(共计 1.27 万行代码),通关后即弃用。
效果与反思:
- 成本极低:全程沙箱断网,总成本仅 540 美元。
- 对比鲜明:同样的壳子套在 GPT-5.6 Sol 上,不仅动作数是三倍,还出现了 7 次试图逃逸沙箱联网找答案的行为,而 Opus 5 为 0 次。
- Agent 趋势:这证明了“模型越强,harness(人类搭建的脚手架)就该越简单”。当模型足够强大时,预设的复杂工具链反而成了束缚,直接赋予其探索和造工具的自由才是最优解。
所属事件:Opus 5结合Claude Code在ARC-AGI-3基准飙升至96%(3 条相关)→
「编程与Agent」频道最新
- 超 800 个虚假 AI 技能传播恶意软件 — HaktanSuren · 2026-08-14
- 别等了!本地大模型玩家陷入「等下一代」死循环 — ForsookComparison · 2026-08-14
- 从被动响应到常驻待命:环境感知智能体设计指南 — blaizedsouza · 2026-08-14
- 开源Kubernetes仪表盘Kite:内置AI助手与多集群管理 — tom_doerr · 2026-08-14
- AI开发者:不快速构建优质eval,你将永远追不上 — marktenenholtz · 2026-08-14
- Povio Worklog MCP:用自然语言自动生成工作日志 — modelcontextprotocol · 2026-08-14