BrokenArXiv 基准更新:只考上月被推翻的猜想,GPT-6 Astra 居首
scaling01 · x · 2026-09-16
BrokenArXiv 与 ArXivMath 基准发布最新版本:题目改为聚焦最近一个月内在 arXiv 上被推翻的猜想,并让模型在 harness 中执行而非直接经 API 调用,考察更贴近真实研究场景。作者称模型表现依然亮眼,GPT-6 Astra 排名第一。推文以「Anthropic 兄弟们情况不妙」的调侃口吻引用了这一发布。
「模型」频道最新
- ChatGPT 会话串线?用户报告不同会话互相回答对方的提问 — koltregaskes · 2026-09-16
- 曝 OpenAI 开发 Codex Replay:可并行回放对比历史任务线程 — testingcatalog · 2026-09-16
- OpenRouter 上线神秘模型 Union Alpha:免费 256K 上下文 — gaganghotra_ · 2026-09-16
- 前几小时拿到权限,开发者用 Jev 秒建演示项目 — suchenzang · 2026-09-16
- TabPFN-3.5 开箱登顶 Kaggle Otto 赛题,回放旧赛成绩遭质疑 — RichmanRonald · 2026-09-16
- Bindu Reddy 爆料:Opus 5.2 内测、Grok 4.8 数周内发布、OpenAI 测 Astra+ — bindureddy · 2026-09-16