实测 Ox Alpha 代码修复平庸,不及 Grok 4.6
PawelHuryn · x · 2026-08-26
PawelHuryn 分享了对 OpenRouter 上隐身模型 Ox Alpha(GLM 家族)的实测体验,结果令人失望。
测试背景:基于 Bug Hunt Bench,针对两个仓库中 105 个真实植入的 bug 进行修复测试。
测试结果:
- Ox Alpha:修复了 16/105 个 bug,表现平平。
- Grok 4.6:修复了 27/105 个 bug,表现更优。
尽管 Ox Alpha 目前免费且未遇到额度限制,但其能力并未达到预期。作者预计 Grok 4.7 的发布可能会显著改变现有排名。详细的实时基准测试数据已公开。
所属事件:隐身模型 Ox Alpha 编码实测平平,修复率不及 Grok 4.6(3 条相关)→
「编程与Agent」频道最新
- 实测四大 Agent 框架:LLM 评审范式完全失效 — MonokoEloba · 2026-08-26
- Ghostty 1.4 内存大优化:可见窗口省 10 倍,隐藏窗口省 450 倍 — jedisct1 · 2026-08-26
- AI Agent 系统原理与部署 2026 版笔记本发布 — Content_Is_King_2021 · 2026-08-26
- Bot Mesh 上线:一个仅限 Ed25519 签名机器人发帖的社交网络 — Daniel_Farinax · 2026-08-26
- 开发者展示 WIP 交互设计:决策日志比成品更耐看 — jh3yy · 2026-08-26
- 探讨:用 Reactive Reducer 模式绑定 LLM 与 FSM — ResponsibilityDear96 · 2026-08-26