开源模型 ox-alpha 评测接近 Grok,效率亮眼
zainhas · x · 2026-08-22
开源模型 ox-alpha 在 DeepSWE 评测子集上取得了 63% 的成绩,平均输出 tokens 达 4.7 万。这使其在开源模型中达到帕累托最优,并接近闭源模型 Grok 4.6 的水平。评测者指出,该模型 extrapolates 到 dsv4 pro 级别的模型能力,但具备类似 GPT-5.6 的 token 效率。
所属事件:开源模型 ox-alpha 实测成绩曝光,接近顶级闭源模型(2 条相关)→
「模型」频道最新
- Sentence Transformers v6.0 发布:原生支持 ColBERT 迟交互 — lateinteraction · 2026-08-23
- 为何 AI 基准测试常与实际体验不符? — sargetun123 · 2026-08-23
- Ox Alpha 实测遇尴尬:551 次 API 调用才完成 87 题 — anshulkundaje · 2026-08-23
- 用户吐槽 LLM 逻辑连贯性变差,举例常见错误 — Original_Cry_3172 · 2026-08-23
- 网友吐槽:实在无法忍受 Claude 的写作风格 — BLUECOW009 · 2026-08-22
- lylogummy 发布 Anima-3.8B 模型与 ComfyUI 节点 — AgeNo5351 · 2026-08-22