Vero 揭差距:agent 不建可复用引理库,74% 证明行靠辅助引理

dawnsongtweets · x · 2026-08-23

Vero 结果揭示了能力差距所在:最强 agent 能通过 87% 的单条规约,但留下 16 个仓库未完成——剩余规约编码了跨模块不变式,需要可复用的引理库,而 agent 很少主动构建。在 82 次完整求解中,约 74% 的证明行位于跨规约共享的辅助引理里。agent 有时还会绕开难验证的参考算法,自己写满足同样规约的更简单实现。

所属事件:Dawn Song 团队发布首个代码库级形式化验证基准 Vero(8 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →