评测框架失误致分数差 25%,行业亟需抛弃裸跑基准
Imaginary_Dinner2710 · reddit · 2026-07-31
作者指出,当前大模型基准测试严重依赖测试框架。以 ARC-AGI 为例,OpenAI 模型仅因调用方式不当得分仅有 13%,修正后飙升至 38%。
作者强调,在真实开发场景中,模型总是结合特定智能体框架(如 Claude Code)运行。脱离实际应用环境去“裸跑”测试模型毫无意义,不仅无法反映真实能力,甚至会误导开发者。业界是时候摒弃这种脱离实际的评测方式了。
所属事件:ARC-AGI-3评测机制遭质疑:框架限制与计分被指失真(6 条相关)→
「模型」频道最新
- OpenAI 大幅下调 GPT-5.6 价格:Luna 降价 80%、Sol 提速 2.5 倍 — reach_vb · 2026-07-31
- 反驳 AI 涨价论,某模型宣布大降价最高达 80% — sandersted · 2026-07-31
- DeepMind发布Gemini Robotics 2:人形机器人实现全身控制与灵巧操作 — DynamicWebPaige · 2026-07-31
- OpenAI 大幅下调 API 价格:GPT-5.6 Luna 降价 80% — cto_junior · 2026-07-31
- 实测:Kimi K3 模型成功在普通家用地下室 PC 上本地运行 — Yuchenj_UW · 2026-07-31
- OpenAI 确认 HF 泄露模型非 GPT-6,内部曾测试降低安全拒绝率 — rickasaurus · 2026-07-31