自建编码评测VulcanBench-SWE v4:超时升至10小时防失真

ChrisUniverse · x · 2026-09-04

作者 morganlinton 分享其自建评测套件 VulcanBench-SWE v4 对新一批模型的测试结果(以 Fable 5.1 为例):

核心看点:对编码模型评测而言,超时设定、防作弊与部分给分是影响结果可信度的三个关键工程细节。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →