GPT-5.5 仅完全验证 27/43 仓库,10 仓库所有配置全军覆没

dawnsongtweets · x · 2026-08-23

Vero 对前沿模型极具挑战性:90 分钟预算内,最佳配置 GPT-5.5(xhigh 推理档) 在 code-and-proof 模式下仅完全验证 43 个仓库中的 27 个,proof-only 模式 25 个;Claude Opus 4.8 分别只做到 8 个和 10 个。全部 8 种测试配置中,有 10 个仓库无一被解决。

所属事件:Dawn Song 团队发布首个代码库级形式化验证基准 Vero(8 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →