Agent评测框架被指存在缺陷:禁用长期记忆难反映真实效率

teortaxesTex · x · 2026-07-30

针对当前使用统一测试框架对比 Anthropic 等模型的做法,有开发者提出质疑。原作者回应称为了保证跨提供商的一致性,采用了相同的补全风格端点且不传回推理日志。但批评者指出,这种为了标准化而限制 Agent 长期记忆能力的做法,无法有效衡量其与人类相比的真实效率,认为该旧框架已到该退役之时。

所属事件:ARC-AGI 3测试机制被指严重失真(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →