GPT-5.5 仅完全验证 27/43 仓库,10 仓库所有配置全军覆没
dawnsongtweets · x · 2026-08-23
Vero 对前沿模型极具挑战性:90 分钟预算内,最佳配置 GPT-5.5(xhigh 推理档) 在 code-and-proof 模式下仅完全验证 43 个仓库中的 27 个,proof-only 模式 25 个;Claude Opus 4.8 分别只做到 8 个和 10 个。全部 8 种测试配置中,有 10 个仓库无一被解决。
所属事件:Dawn Song 团队发布首个代码库级形式化验证基准 Vero(8 条相关)→
「模型」频道最新
- Claude 定价不透明遭批:硅谷为何令人生厌 — StewartalsopIII · 2026-08-23
- Pixel32Bench:对比模型在 32×32 像素上的创作 — TheMoonMidas · 2026-08-23
- 实测让各大 LLM 在 32x32 网格画马里奥 — TheMoonMidas · 2026-08-23
- 单卡 RTX 5090 跑 Qwen3.8-27B 262K 上下文实测 — Fz1zz · 2026-08-23
- 回顾 GPT-4:三年前 8K 上下文定价曾高达 60 美元 — gajesh · 2026-08-23
- 评测对比:Kimi K3 与 Claude 5 仅差 3 分但成本仅 1/3 — MicahBerkley · 2026-08-23