实测 ox-alpha 通过 DeepSWE 58.4%,与 Claude Opus 持平
apples_jimmy · x · 2026-08-22
针对传闻中 ox-alpha 在 DeepSWE 基准上约 80% 的通过率,第三方进行了完整实测。结果显示,该模型在 113 个任务中实际解决了 66 个,通过率为 58.4%,表现几乎与 Claude Opus 4.8 (59%) 持平。测试还发现,9.7% 的任务失败归因于工具调用格式错误而非推理能力不足。
所属事件:开源模型 ox-alpha 实测成绩曝光,接近顶级闭源模型(2 条相关)→
「模型」频道最新
- Sentence Transformers v6.0 发布:原生支持 ColBERT 迟交互 — lateinteraction · 2026-08-23
- 为何 AI 基准测试常与实际体验不符? — sargetun123 · 2026-08-23
- Ox Alpha 实测遇尴尬:551 次 API 调用才完成 87 题 — anshulkundaje · 2026-08-23
- 用户吐槽 LLM 逻辑连贯性变差,举例常见错误 — Original_Cry_3172 · 2026-08-23
- 网友吐槽:实在无法忍受 Claude 的写作风格 — BLUECOW009 · 2026-08-22
- lylogummy 发布 Anima-3.8B 模型与 ComfyUI 节点 — AgeNo5351 · 2026-08-22