Humanize+GPT-5.5 拿下 PutnamBench 670/672,登顶榜首
songhan_mit · x · 2026-09-06
Ligeng Zhu 团队宣布,基于 Humanize 的 Agent Flow 驱动 GPT-5.5,在普特南数学竞赛形式化基准 PutnamBench 上解出全部 672 题中的 670 题(99.7% 通过率),用时约 5 小时,所有证明均经 Lean 形式化验证,登顶官方排行榜第一名。作者称升级到 humanize2 后达成 100% 的表述。
- 核心主张:当各家模型 token 能力接近时,更好的 Agent Flow(工作流编排)是扩展 agent 能力的关键
- PutnamBench 是 TrishulLab 维护的形式化数学推理基准,支持 Lean/Isabelle/Coq 多种证明助手
- 注意:该结果为团队自述,尚未经第三方独立复现
「编程与Agent」频道最新
- Claude Code 2.1.263 更新:prompt token 涨 16%,系统提示占比升至 79% — ClaudeCodeLog · 2026-09-06
- 开发者围观 Fable、Astra、Anima 三 agent 协作建「庇护所」 — RileyRalmuto · 2026-09-06
- 为 RL 训练做确定性奖励:作者用 Astra 构建标题可读性评分函数 — ivan_bezdomny · 2026-09-06
- LangChain 护栏实战:用 middleware 拦截 Agent 风险行为 — kalyan_kpl · 2026-09-06
- 实测 Astra:单文件 Minecraft 一次成型,145 分钟跑通完整世界模拟 — tegridyblues · 2026-09-06
- OpenAI 发 GPT-6 Astra 提示指南:模型太强,SKILL 和 AGENTS.md 规则要大幅删减 — xiaohu · 2026-09-06