自建编码评测VulcanBench-SWE v4:超时升至10小时防失真
ChrisUniverse · x · 2026-09-04
作者 morganlinton 分享其自建评测套件 VulcanBench-SWE v4 对新一批模型的测试结果(以 Fable 5.1 为例):
- 任务设计:全部任务来自开源仓库的真实 PR,模拟普通工程团队会交给模型的实际编码工作,而非人造题。
- 超时延长:超时上限从 2 小时提升至 10 小时。虽然运行成本大增,但可保证模型失败是因为做不出而非超时,结果更干净。
- 防作弊与部分给分:新增 guardrails 防止模型「作弊」,并引入 partial credit——即使任务未完全通过也能按完成度得分,评分更细。
- 多档位测试:对所有 effort level(large/low 等)逐一跑分,这也是他的评测耗时特别长的原因。
- 首个成绩:Fable 5.1 Low 得分 82.6(原帖数字被截断)。
核心看点:对编码模型评测而言,超时设定、防作弊与部分给分是影响结果可信度的三个关键工程细节。
「编程与Agent」频道最新
- Clanker Cloud 开放免费试用:注册即赠 20 美元额度 — tekbog · 2026-09-04
- Clanker Cloud 亮相:自建 Agent 一条龙,企业销售踩坑实录 — tekbog · 2026-09-04
- 像运营公司一样管 AI:Grok Bot 团队配项目经理分工协作 — FinanceYF5 · 2026-09-04
- AI 找漏洞比修漏洞快,工程师如何应对 CVE 积压 — _jaydeepkarale · 2026-09-04
- AAV 提出在意图与执行间加独立授权层治理 AI Agent — CarlosMarreroAAV · 2026-09-04
- 花 40 美元跑实验压降评估成本,开发者:买不起智能真难用 AI — zeeg · 2026-09-04