开源self-bench:从你的代码库自动构建私有编码Agent评测
ricklamers · x · 2026-08-15
self-bench 是一个开源包,可从仓库中已有的工作(如合并的PR)自动构建私有编码Agent基准。它从变更前的提交重建任务,为每个任务生成隐藏测试和参考解决方案,并导出为Harbor格式,用于比较不同模型在真实代码库上的表现。
「编程与Agent」频道最新
- OpenRouter推出Ori Prime Agent,可访问500+模型 — samsja19 · 2026-08-15
- AI Engineer 大会 Computer Use 专题议程全览 — proceduralia · 2026-08-15
- Hermes Agent 支持将配置全量导出为单文件 — Saboo_Shubham_ · 2026-08-15
- 讨论:生产环境中 Agent 写权限的边界与风险 — justinotherflow · 2026-08-15
- PIRT:在Android手机上直接运行Linux Agent — Glad_Raspberry_6795 · 2026-08-15
- Gatsby 创始人打造 AI Agent 框架:从失败到开源 — ryanbed · 2026-08-15