为何需要仓库级验证:单函数 benchmark 无法覆盖真实软件

dawnsongtweets · x · 2026-08-23

Vero 的动机:AI agent 写代码很强,但在真实软件规模上能否信任?现有 benchmark 要么只针对单函数,要么只在固定实现上评测证明生成;而真正的验证软件(OS 内核、密码协议、分布式系统)存在于多模块仓库中——代码、规约、证明深度相互依赖,一次重构就可能让全代码库的证明失效。此前没有任何 benchmark 在此规模上评测代码+证明的联合生成与形式化验证。

所属事件:Dawn Song 团队发布首个代码库级形式化验证基准 Vero(8 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →