实测 ox-alpha 通过 DeepSWE 58.4%,与 Claude Opus 持平

apples_jimmy · x · 2026-08-22

针对传闻中 ox-alpha 在 DeepSWE 基准上约 80% 的通过率,第三方进行了完整实测。结果显示,该模型在 113 个任务中实际解决了 66 个,通过率为 58.4%,表现几乎与 Claude Opus 4.8 (59%) 持平。测试还发现,9.7% 的任务失败归因于工具调用格式错误而非推理能力不足。

所属事件:开源模型 ox-alpha 实测成绩曝光,接近顶级闭源模型(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →