评测框架失误致分数差 25%,行业亟需抛弃裸跑基准

Imaginary_Dinner2710 · reddit · 2026-07-31

作者指出,当前大模型基准测试严重依赖测试框架。以 ARC-AGI 为例,OpenAI 模型仅因调用方式不当得分仅有 13%,修正后飙升至 38%。

作者强调,在真实开发场景中,模型总是结合特定智能体框架(如 Claude Code)运行。脱离实际应用环境去“裸跑”测试模型毫无意义,不仅无法反映真实能力,甚至会误导开发者。业界是时候摒弃这种脱离实际的评测方式了。

所属事件:ARC-AGI-3评测机制遭质疑:框架限制与计分被指失真(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →