谷歌Stellar Colosseum:多智能体协作 harness 证明数学新定理
IgorCarron · x · 2026-09-18
Google(含 Vahab Mirrokni 等)发布论文《Stellar Colosseum: A Many-Agent Harness for Long-Horizon Research in Mathematics and Theoretical Computer Science》(arXiv:2609.15983),并已作为 Long Proof 模式集成进 Antigravity 的 Teamwork 框架(/teamwork-preview)。
- 动机:LLM 能给出貌似可信的短证明,但在长程研究问题(依赖一连串不确定且相互关联的决策)上仍不可靠。
- 架构:模型无关的 harness,把流程拆为策略探索 → 就绪门控(判断路线是否成熟可分解)→ 证明计划表示为相互依赖的章节级子问题 → 把验证器的发现回路由到受影响部分;各阶段并行生成候选、针对性证伪攻击,再通过重叠随机采样树聚合把候选与批评合并成单一研究产物。
- 成果:配合 Gemini 3.1 Pro,取得多个针对公开问题的新结果,并在定理证明与竞赛编程基准上评估。
- 转发者 Igor Carron 评价:「他们(传统研究者)会因为这类策略而衰落。」
「编程与Agent」频道最新
- 开发者用无 LLM 聊天机器人引质疑:除速度外还差什么 — jasonkneen · 2026-09-18
- Anthropic 工程师:90% 已在用自我改进循环,提示词时代终结 — Roger_M_Taylor · 2026-09-18
- AI 工程师 Dave Ebbelaar 开源 Cookbook,可直接复制的 AI 系统代码 — Roger_M_Taylor · 2026-09-18
- 三个 GitHub 开源工具让 AI Agent 自由抓取全网数据 — Roger_M_Taylor · 2026-09-18
- 多智能体失控如传染病:不安全交接可使危害率飙至 95% — dair_ai · 2026-09-18
- Jack Dorsey 开源全 AI 代理运营生意框架,GitHub 星数破 2.9 万 — Roger_M_Taylor · 2026-09-18