实测 Ox Alpha 代码修复平庸,不及 Grok 4.6

PawelHuryn · x · 2026-08-26

PawelHuryn 分享了对 OpenRouter 上隐身模型 Ox Alpha(GLM 家族)的实测体验,结果令人失望。

测试背景:基于 Bug Hunt Bench,针对两个仓库中 105 个真实植入的 bug 进行修复测试。

测试结果:

尽管 Ox Alpha 目前免费且未遇到额度限制,但其能力并未达到预期。作者预计 Grok 4.7 的发布可能会显著改变现有排名。详细的实时基准测试数据已公开。

所属事件:隐身模型 Ox Alpha 编码实测平平,修复率不及 Grok 4.6(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →