评测框架设置微调即可大幅改变 ARC-AGI 成绩

teortaxesTex · x · 2026-08-01

近期关于 ARC-AGI-3 评测的讨论揭示了一个关键现象:执行框架的微小设置变动会显著影响模型的最终得分。

有开发者指出,仅对 Harness 的设置进行两处调整,就使 Claude 3.5 Sonnet 的成绩获得了大幅提升。这引发了社区对当前大模型能力评估准确性的担忧,并猜测像 DeepSeek V4 等尚未完全释放潜力的模型,其真实能力可能被现有的测试框架所低估。

所属事件:ARC-AGI 3评测机制遭质疑:框架限制与计分规则被指失真(8 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →