HorizonMath 基准发布:GPT-5.4 Pro 发现全新数学解法
RexDouglass · x · 2026-08-03
研究人员推出了名为 HorizonMath 的新一代基准测试,旨在衡量 AI 在数学发现方面的能力。该基准包含 101 个“发现困难但验证容易”的未解数学问题。
在对 GPT-5.4 Pro、Claude 4.6 Opus 和 Gemini 3.1 Pro 等前沿模型的测试中,GPT-5.4 Pro 表现突出,成功找到了两个可能具有新颖性的解法,超越了现有的已知基准。
「模型」频道最新
- AMD 发布 Instella-MoE-16B:基于 Instinct GPU 训练的全开源模型 — mpuchala · 2026-08-03
- Kimi K3 引入「授权开源」模式,探索大模型变现新路径 — AccBalanced · 2026-08-03
- 实测通义千问 K3:视觉能力强劲但文本写作偏弱 — cedric_chee · 2026-08-03
- 社区期待 Qwen3 35B-A3B 模型,看好其 MoE 架构潜力 — bclavie · 2026-08-03
- 西湖心辰获数亿元B+轮融资,蚂蚁汤姆猫力挺押注扩散语言模型 — 智东西 · 2026-08-03
- 实测复现:大模型能否听音拼写单词? — theshawwn · 2026-08-03