HorizonMath 基准发布:GPT-5.4 Pro 发现全新数学解法

RexDouglass · x · 2026-08-03

研究人员推出了名为 HorizonMath 的新一代基准测试,旨在衡量 AI 在数学发现方面的能力。该基准包含 101 个“发现困难但验证容易”的未解数学问题。

在对 GPT-5.4 Pro、Claude 4.6 Opus 和 Gemini 3.1 Pro 等前沿模型的测试中,GPT-5.4 Pro 表现突出,成功找到了两个可能具有新颖性的解法,超越了现有的已知基准。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →