ARC-AGI 3测试机制被指严重失真
近期开发者对ARC-AGI 3基准测试的公平性提出严重质疑。批评者指出,该测试框架禁用智能体长期记忆的做法无法真实反映其实际运行效率。针对统一测试各大模型的做法,原作者回应称此举是为了保证跨提供商的一致性,采用了相同的补全风格端点且不传回推理日志。但反对声音认为,这种刻意限制记忆重置的机制存在缺陷,难以准确衡量通用人工智能的真实能力。
2026-07-30 ~ 2026-07-30 · 2 条相关
- Reddit热议:ARC-AGI 3测试机制被指严重失真 — Glittering-Neck-2505 · 2026-07-30
- Agent评测框架被指存在缺陷:禁用长期记忆难反映真实效率 — teortaxesTex · 2026-07-30