BrokenArXiv 基准更新:只考上月被推翻的猜想,GPT-6 Astra 居首

scaling01 · x · 2026-09-16

BrokenArXiv 与 ArXivMath 基准发布最新版本:题目改为聚焦最近一个月内在 arXiv 上被推翻的猜想,并让模型在 harness 中执行而非直接经 API 调用,考察更贴近真实研究场景。作者称模型表现依然亮眼,GPT-6 Astra 排名第一。推文以「Anthropic 兄弟们情况不妙」的调侃口吻引用了这一发布。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →