为何需要仓库级验证:单函数 benchmark 无法覆盖真实软件
dawnsongtweets · x · 2026-08-23
Vero 的动机:AI agent 写代码很强,但在真实软件规模上能否信任?现有 benchmark 要么只针对单函数,要么只在固定实现上评测证明生成;而真正的验证软件(OS 内核、密码协议、分布式系统)存在于多模块仓库中——代码、规约、证明深度相互依赖,一次重构就可能让全代码库的证明失效。此前没有任何 benchmark 在此规模上评测代码+证明的联合生成与形式化验证。
所属事件:Dawn Song 团队发布首个代码库级形式化验证基准 Vero(8 条相关)→
「研究」频道最新
- Pixel32Bench:对比模型在 32×32 像素上的创作 — TheMoonMidas · 2026-08-23
- AI 加速材料发现:云实验室与模拟结合的机会 — JacquesThibs · 2026-08-23
- Marin 535B 模型启动全透明训练,公开 FLOPs 与配置 — _ScottCondron · 2026-08-23
- 开发者称 MCP 研究论文错误百出、疑部分由 AI 生成 — benfielding · 2026-08-23
- NanoGPT 速通排行榜汇总:最快训练与性能基准 — RichmanRonald · 2026-08-23
- Prompt Injection 损失极小?攻击成本降低或带来新风险 — joshua_saxe · 2026-08-23