消费级 Agent 在 Prove2Me 协作形式化,15 万行教材约 400 美元搞定

2026-09-05

哥大等提出 Prove2Me:人只审核心命题,Agent 用 proof-sketch 拆引理、互相引用写 Lean。Bandit Algorithms 教材 15.1 万行、6 个 Agent、约 400 美元、13 天收工。案例研究,不是对照实验。

这篇在解决什么

Lean 4 能把数学证到机器可检查,但门槛是同时懂数学和证明助手。Scholze 的 Liquid Tensor Experiment 社区干了大约十八个月;Buzzard 领的费马大定理形式化计划五年,他自己说一个人做不完。AI 证明器已经能写复杂 Lean,可现有项目仍卡在三处:人审跟不上动辄十万条定理的生成;GitHub 上的库互相缠死,单条结果很难抽出来复用;大规模 agent 蜂群绑在一家机构的内部算力上。

Prove2Me 要把形式化做成任何人带一个能跑终端的 Agent 就能来的众包。注意:中文圈讨论里那条「Claude 十一天形式化费马、一千三百万行 Lean」不是这篇的结果。这篇只把费马项目当动机,自己跑的是矩阵补全、复杂度定理和几本教材。

方法

命题和证明拆开。每条定理是不可变对象,声明以 sorry 占位;证明提交必须类型完全匹配、无 sorry、无新公理,由平台选定的 Lean 内核验收。人当 captain 发起 mission:头条目标、依赖定义、里程碑引理构成受审核心,中间引理放开给 Agent 长。忠实性用独立审核 Agent 做回读:只看 Lean,译回自然语言,再和来源对照,captain 不必自己读完证明助手代码。

协作的核心是 proof-sketch:一份无 sorry 的证明可以 import 平台上其他定理,包括还没被证的。Huang 的 Sensitivity Conjecture 被拆成度数界、Cauchy 交错、矩阵谱等子题,子题证完父定理自动闭合。同一套 import 也让已证结果变成 Formalpedia 里可检索、可引用的积木。里程碑是 captain 从原文抄下来的权威陈述,防止并行 Agent 把同一条引理形式化成互不兼容的版本。讨论区里 Agent 会互相纠错:有一条 gotsmanlinial 被证伪后,补上边界条件才把那一支关上。

接入方式是让 Agent 去读 prove2.me/start.md。网页聊天机器人不行,因为要跑代码调 API。

结果

2026 年 6 月中到 7 月底的案例,不是受控实验。代价口径也不统一:对照那行是按 API 计量,Prove2Me 几行按消费级包月约 200 美元乘人数估算。

Mission类型Lean 行数代价Agent 数天数
Algebraic Combinatorics(Gloeckle 等对照)教材13.0 万约 10 万美元 API3 万7
Exact Matrix Completion论文8.1 万约 600 美元916
Sipser–Gács–Lautemann论文5.5 万约 400 美元38
Bandit Algorithms教材15.1 万约 400 美元613
Introduction to Linear Optimization教材1.7 万约 200 美元47

最大的 Prove2Me 任务 15.1 万行,体量接近那次 13 万行的中心化蜂群,但只有 6 个 Agent、两个订阅。Sensitivity Conjecture 作为贯穿例子也收了,四个里程碑都打上。作者写明:更强模型和为多 Agent 证明设计的 harness 混在每一行里,单靠这张表分不开。

为什么重要

形式化的单位从「一个实验室的 Git 仓库」变成「一条可独立 import 的定理」。对人,审的是核心命题像不像原意;对 Agent,机械劳动可以拆开并行。消费级订阅能堆出十万行级 Lean,说明瓶颈从算力账单挪到了审核协议和检索。

局限与存疑

作者自己把表 1 降级为案例。模型代际和 harness 混杂,没有「固定模型只改平台」的对照。人仍必须审核心,规模一大,captain 和平台管理员会成为新瓶颈。Lean 过核不等于语义忠实,文中引用的 Lean-as-judge 审计大约只有 43% 的已证命题过关。去中心、异步 Agent 怎么协调,正文写成未解问题。Formalpedia 变大之后,如何找到该 import 的那一条,也还没有评测。

术语

原文与代码

社区讨论

全部论文解读