开源self-bench:从你的代码库自动构建私有编码Agent评测

ricklamers · x · 2026-08-15

self-bench 是一个开源包,可从仓库中已有的工作(如合并的PR)自动构建私有编码Agent基准。它从变更前的提交重建任务,为每个任务生成隐藏测试和参考解决方案,并导出为Harbor格式,用于比较不同模型在真实代码库上的表现。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →