Vals AI 发布 Vibe Code Bench:专测模型改代码不搞坏旧功能

burny_tech · x · 2026-09-18

评测机构 Vals AI 发布 Vibe Code Bench(1-100 级),指出既有编码 benchmark 都止步于「第一个能跑通的版本」,而真实工程中真正难的是后续。

该基准考察的核心问题是:模型能否在产品上承受大量修改的同时,不破坏已经可用的功能——即持续迭代下的回归控制能力。基准以渐进难度(1 到 100)衡量模型在改动堆积下的表现极限。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →