Google 多智能体系统攻克长程数学证明,定理证明率达 71%
omarsar0 · x · 2026-09-16
Google Research 发布了一个面向长程任务的多智能体框架 Stellar Colosseum,专攻研究级数学定理证明,并在开放问题上产出了新结果。
核心机制:系统分阶段运行——先并行探索多条证明策略,通过 readiness gate 后将路线拆解为节级别的子问题;每阶段内并行生成候选证明、用针对性证伪攻击,再连同批判意见合并;验证器的发现会反馈给受影响的章节。
成绩:
- 使用 Gemini 3.1 Pro 与 Gemini 3.7 Flash,在 TCS-Bench(取自 FOCS、STOC、SODA 论文的研究级定理证明任务集)上达到 71.0%
- 加入执行反馈后,解决了 222 道 Codeforces 题目中的 218 道
「编程与Agent」频道最新
- 离职即失访问权:开发者痛失 5 年 commit 历史,无法用于训练个人 agent — DanielLockyer · 2026-09-16
- Neo4j 将办 GraphRAG 工作坊:知识图谱 + 智能体检索实战 — camerongreen95 · 2026-09-16
- 开发者首次让 LLM 全面找 bug,竟挖出可变砖设备的全链路攻击 — matthew_d_green · 2026-09-16
- 曝 Claude Code 将迎 Sessions Hub:本地云端会话统一管理 — testingcatalog · 2026-09-16
- 开源多人 AI 助手 Rowboat:团队白板协作,@rowboat 直接实现 — ycombinator · 2026-09-16
- 开发者开源工具扫描会话日志,揪出 agent 反复踩的同一个坑 — EvenAd1183 · 2026-09-16