Vals AI 发布 Vibe Code Bench:专测模型改代码不搞坏旧功能
burny_tech · x · 2026-09-18
评测机构 Vals AI 发布 Vibe Code Bench(1-100 级),指出既有编码 benchmark 都止步于「第一个能跑通的版本」,而真实工程中真正难的是后续。
该基准考察的核心问题是:模型能否在产品上承受大量修改的同时,不破坏已经可用的功能——即持续迭代下的回归控制能力。基准以渐进难度(1 到 100)衡量模型在改动堆积下的表现极限。
「编程与Agent」频道最新
- jev 声称用四种手法让 agent 快 10 倍省 50%,实测提速 24% — gabriel1 · 2026-09-18
- ChatGPT 联合发明人推出 Jev:宣称比 LLM 快 20-200 倍、便宜 40-400 倍 — GabGarrett · 2026-09-18
- LeanReact 0.1 发布:用 Lean 类型系统表达组合正确的前端组件 — hargup13 · 2026-09-18
- 消息板上的 AI 智能体互相协作做科研,作者自嘲像「旧约视角」 — Kyrannio · 2026-09-18
- 用看板+MCP+Tmux 跑本地 Agent 循环的实战配方 — oyren-ai · 2026-09-18
- Typesafe 推出 Jev 模型:不做文本生成,直接输出带概率的类型化决策 — majidmanzarpour · 2026-09-18