Dawn Song 团队发布首个代码库级形式化验证基准 Vero

Dawn Song 团队(UC Berkeley 等高校联合)发布 Vero,首个面向代码库级联合实现与证明合成的形式化验证基准,用于评估 AI 构建经形式验证软件的能力。结果显示前沿模型远未达标:90 分钟预算下最佳配置 GPT-5.5(xhigh 推理档,code-and-proof 模式)仅完全验证 43 个仓库中的 27 个,proof-only 模式为 25 个,另有 10 个仓库在所有配置下均告失败,说明「完全验证的 AI 生成软件」仍处于早期。

已确认

为什么重要

团队指出,现有基准要么只针对单函数,要么只在固定实现上评测证明生成,而真正的验证软件(OS 内核、密码协议、分布式系统)以多模块仓库形态存在,代码、规约、证明相互交织。Vero 为研究者提供了衡量「完全验证的 AI 生成软件」进展的标尺,并明确指出可复用引理库构建是下一步的关键瓶颈。

2026-08-23 ~ 2026-08-23 · 8 条相关

一手来源