VeriSoftBench 发布:仓库级 Lean4 形式化验证,最强 LLM 仅过 41%
xiye_nlp · x · 2026-10-08
- 在 COLM 会议上,研究者发布了 VeriSoftBench——首个面向仓库规模 Lean 4 形式化验证的 benchmark。
- 包含来自 23 个开源形式化方法仓库的 500 条证明义务,保留真实仓库上下文与跨文件依赖。
- 提供两种评测模式:Curated deps 与 Full repo context;前沿 LLM 仍表现挣扎,最佳成绩仅 41.0%(curated)/ 34.8%(full repo context)。
「研究」频道最新
- Perplexity 发布 pplx-embed-v2-late:免 OCR 晚期交互嵌入模型霸榜 — perplexity_ai · 2026-10-08
- Gary Marcus 炮轰 AI 数学证明报告:信息模糊到过不了同行评审 — GaryMarcus · 2026-10-08
- NeurIPS 论文 LADE:首 token 概率分布藏着跨模型越狱防御信号 — mohitban47 · 2026-10-08
- 研究者用 AI 设计 mRNA 疫苗,室温稳定期可达一年 — Polymarket · 2026-10-08
- MIT 提出 SOLE-R1:视频语言推理充当唯一奖励,机器人零样本在线学技能 — micoolcho · 2026-10-08
- 微软开源 Agent Lightning v1.0:3500 行代码让真实 agent 直接参与 RL 训练 — Microsoft Research · 2026-10-08