Ox Alpha 跑出 SWE-bench 96% 分数存疑
No_Tip9917 · reddit · 2026-08-22
博主在 SWE-bench Verified Mini (50 任务) 上测试免费模型 Ox Alpha,官方脚手架下达到了惊人的 96% 解决率 (48/50)。这一成绩甚至超过了 Claude Fable 5 (95%),且远超同类模型在同等条件下的表现 (77%)。博主对此表示高度怀疑,并列出了需谨慎看待的理由:
- 数据集局限:Mini-50 仅包含 Django 和 Sphinx,二者在训练数据中占比极高,可能存在记忆污染。
- 样本量小:n=50 存在约 ±3pp 的采样误差。
- 任务陈旧:所有任务均来自 2019-2022 年的 PR,现代模型可能见过类似问题。
- 端点不可控:免费端点的缓存和限流机制不明。
尽管结果可能虚高,但该实验仍提供了一个开源/免费模型在代码修复任务上的极端案例。
「编程与Agent」频道最新
- Fable 提示词:做编排验收,任务派发给 Subagent — dotey · 2026-08-22
- Gemini 3.7 Flash 拿下 CAD 计算机使用评测第一 — DynamicWebPaige · 2026-08-22
- Middle Manager 模式:多 Agent 并发实现代码 — vinvan · 2026-08-22
- Stein 访谈:Agent 工程最新进展与 2026 创业方向 — ycombinator · 2026-08-22
- Agent 任务死信处理六条军规:限制重试与隔离失败作业 — blaizedsouza · 2026-08-22
- VGB 算法用回溯修复长文生成中采样错误的累积灾难 — arena · 2026-08-22