Ox Alpha 跑分 63%,实测代码能力与体验
AccBalanced · x · 2026-08-23
开发者 @davis7 对神秘模型 Ox Alpha 进行了 DeepSWE 基准测试,最终得分约为 63%,与 DeepSeek V4 Pro 和 Grok 4.6 持平。实测反馈显示,该模型在“语气”和设计上优于 Claude/GPT,能很好处理子代理与复杂任务,代码质量不错;但存在遗留死代码、推理高延迟下效率感低等问题。若其基于 GLM 或小参数开源模型且算力需求低,将极具性价比。
所属事件:Ox Alpha 完整 DeepSWE 实测 63%,此前 80% 系子集误报(6 条相关)→
「模型」频道最新
- 点评 ox 模型:像博士级勤务员的谨慎子智能体 — teortaxesTex · 2026-08-23
- Qwen3.8-27B 推出 GGUF 格式,集成推测解码加速 — z-lab · 2026-08-23
- MiniMax H3 提示词服从度太高,导致视频缺乏生动细节 — DifficultAd5938 · 2026-08-23
- 普林斯顿 i1 模型:全开源文生图方案与 300 组实验 — 机器之心 · 2026-08-23
- AI 生成文本现“费布利什”怪象:否定词错乱与宾主倒装 — alexisgallagher · 2026-08-23
- 实测:Terra 胜过 Sonnet,Flash 速度质量无敌 — cgarciae88 · 2026-08-23