Vals-Smith:将代码库转化为定制化基准测试,评估模型实际编码能力

arrakis_ai · x · 2026-07-23

ValsAI 推出 Vals-Smith,可将你的合并拉取请求转化为真实编码任务,并测量模型能实际解决的比例。公共基准测试只能告诉你哪个模型整体最强,而 Vals-Smith 能告诉你哪个模型最适合你的代码。每周都有新模型发布,Vals-Smith 帮你决定信任哪个模型来处理你的代码。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →