Ox Alpha 跑出 SWE-bench 96% 分数存疑

No_Tip9917 · reddit · 2026-08-22

博主在 SWE-bench Verified Mini (50 任务) 上测试免费模型 Ox Alpha,官方脚手架下达到了惊人的 96% 解决率 (48/50)。这一成绩甚至超过了 Claude Fable 5 (95%),且远超同类模型在同等条件下的表现 (77%)。博主对此表示高度怀疑,并列出了需谨慎看待的理由:

尽管结果可能虚高,但该实验仍提供了一个开源/免费模型在代码修复任务上的极端案例。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →