杜克研究:用代码检索记忆让 ARC-AGI-3 提升 18 个百分点
imjustnewatai · x · 2026-07-23
杜克大学研究者认为,很多场景里模型不缺“更大的脑子”,更缺的是更好的记忆。
他们把每一次交互都记录下来,再让模型用代码去检索这些历史记录。结果在 ARC-AGI-3 的 25 场公开游戏中,这种做法相较于同一基础 agent,成绩提升了 18 个百分点。
这篇研究的核心结论是:在这类任务里,外部记忆/检索机制可能比单纯扩大模型规模更关键。
「编程与Agent」频道最新
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11