Ox Alpha完整DeepSWE跑出63%,或为GLM-5.3 Flash

kimmonismus · x · 2026-08-23

@davis7 对神秘模型 Ox Alpha 完成了完整 DeepSWE 实测,最终得分约 63%,远低于其首次子集测试的 80%,整体水平大致与 GPT-5.6 Sol mid 持平。

@davis7 的详细体验:语音风格比 Claude 或 GPT 更好,设计品味不错,擅长处理 subagent 与长程复杂任务,代码质量好;但有时会留下死代码,不如 Sol 彻底,且尽管 TPS 不低,高推理档位下运行很慢、效率观感不佳。

@kimmonismus 补充观点:如果它真是 GLM-5.3 Flash,却能达到 5.6 Sol mid 的水平并可本地跑在 DGX Spark 上,那将极其划算——一个只耗电费的本地 Sol mid 级模型 24 小时可用,堪称 game changer。

所属事件:神秘模型Ox Alpha完整DeepSWE实测仅63%,此前80%系子集误报(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →