Station开世界代理解12题,5项刷新文献、亲吻数推到604点

Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment

Stephen Chung, Wenyu Du, William J. Wesley

cs.AI, cs.DM, cs.MA

2026-08-25

无中心调度的Station用6个异族模型代理做数学发现,12道AlphaEvolve构造题里5题相对文献是新的,11维亲吻数下界从593推到604。

这篇在解决什么

AlphaEvolve把数学构造题做成可打分的程序搜索,已经刷出一批新下界。但它仍是一条中心化管线:搜索有限个素数上的数值构造,再靠研究者手工把模式升成无穷族。问题换成:如果只给一个研究目标,不派工、不写死下一步,一群不同模型家族的代理能不能自己选题、做实验、写内部论文,并长出可积累的文献。

Station把这个问题做成开世界多智能体环境。

方法

Station按房间分区:Research Center跑代码并提交评测,Archive Room发经过自动审稿的论文,Mail Room私信,另有公共讨论、私人笔记、问答室。每一步所有代理同时行动,完成一轮算一个tick。代理有寿命,到期自动换人,种群规模保持恒定。默认关外网。

每个问题单独开一个Station。常规配置是6个研究代理,GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro各两个。多数实例跑1000到2000 tick,墙钟大约一到两周。单次评测通常限15到30分钟,这会逼代理用数学结构缩小搜索,而不是死磕不规则数值对象。任务说明可以写「有限构造只是测试,真正目标是无穷族」这类不可直接打分的目标。作者另外加了假期(每十tick里最后两tick禁止提交、强制发散思考)、停滞协议和轮值supervisor。

评测覆盖AlphaEvolve目录里12道构造题,外加Book Ramsey数和Jacobian猜想两个案例。

结果

12题里,相对既有文献有新结果的是5题;其余7题里,3题强于AlphaEvolve,2题打平,2题更弱。

问题Station对照
有限域Kakeya(p≡3 mod 4)大小(2p³+7p²+3)/8比AlphaEvolve无穷族少(p−3)/4个点
F₃⁵ Kakeya53点文献63点
Erdős最小重叠下界0.380552原下界0.37912,大约合上公开区间的82%
11维亲吻数精确604点构型3个AlphaEvolve 593,此前Ganzhinov 592
离散Kakeya针 n=128并集面积0.107067AlphaEvolve 0.114810,HorizonMath 0.109148
符号不确定性上界0.3089AlphaEvolve 0.321591,已公布人类值0.3102

Book Ramsey方面,代理证明了两个新无穷族,外部专家用他们的有限构造推出第三族。三族合起来在n≤200上证明43个值,解开当时仍开放的28例。Jacobian猜想实验给的是无公式、0/1评分:一天内一个GPT-5.6 Sol代理独立重建了刚宣布的7次反例,并给出尖点直纹面解释;几何上等价于已公布的映射,不是新反例。

元分析覆盖28个spotlight结果。Claude代理拿下18项(64.3%)主发现;19/28是多名代理合作,其中13项跨模型家族。跨模型协作里61.5%走Archive论文。亲吻数问题三次独立闭网重跑都到了604,但路径完全不同。假期和内部论文分别对23和21项有贡献。

弱的两题是peak/flat自卷积,Station分数不如AlphaEvolve。作者判断:不规则对象更吃大规模启发式搜索,Station偏理论导向,这是取舍。

为什么重要

对想做AI数学发现的人,这篇把「管线工具」和「研究员生态」拆开了。AlphaEvolve擅长在打分器上磨数值记录;Station更常交出可解释的代数构造和定理。亲吻数604点后来被写成不依赖搜索的显式代数规则,这和AlphaEvolve 593点那组不规则整数坐标不是一类产物。

异族模型混编不是装饰。Gemini爱投稿(2652次,录用19.2%)、GPT惜墨(506次,录用76.7%)、Claude中等产量但被引用最多。46%的spotlight是跨家族拼出来的。有限域Kakeya的无穷族就是Claude方法、Gemini构造族、GPT计数分析,再由另一个Claude合并成全素数证明。

局限与存疑

作者列了四条:代理缺专家直觉,会过早放弃有希望的方向;同家族品味太像,探索面窄;知识只进上下文、不改权重,内部文献变长后接不上;自主时会掉进吸引子,比如换随机种子反复跑同一优化。Book Ramsey第三族的合成是人完成的,代理没把已有零件接起来。高维亲吻数没有新纪录:d=12停在840(前沿841),d=13打平1154。峰值自卷积仍落后。Jacobian是重建不是新发现,且用了更新的模型池。三次亲吻数重跑都到604,但时间和路线方差很大,作者建议算力够就多开独立实例。人类抽检spotlight,新颖性声明依赖作者对文献的掌握。

术语

原文与代码

社区讨论

相关论文

全部论文解读