Vals-Smith:将代码库转化为定制化基准测试,评估模型实际编码能力
arrakis_ai · x · 2026-07-23
ValsAI 推出 Vals-Smith,可将你的合并拉取请求转化为真实编码任务,并测量模型能实际解决的比例。公共基准测试只能告诉你哪个模型整体最强,而 Vals-Smith 能告诉你哪个模型最适合你的代码。每周都有新模型发布,Vals-Smith 帮你决定信任哪个模型来处理你的代码。
「编程与Agent」频道最新
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11