GPT-6 Astra 登顶 Terminal-Bench Science,领先第二名 31.4 分
DeryaTR_ · x · 2026-09-21
Vals AI 上线了 Terminal-Bench Science 基准:由领域研究者编写并审校的 70 个科研工作流任务,涵盖信号重建、模型校准等,考察模型能否真正做科学研究。
榜单结果宣称 GPT-6 Astra 以 65.7% 大幅领先,比第二名 Claude Fable 5.1(34.3%)高出 31.4 个百分点;其余模型无一超过 25%,24 个模型中有 12 个得分在 4.3% 及以下。(注:模型名为推文转述,未经官方证实)
「模型」频道最新
- JEV 取消 waitlist 开放:5 美元额度、输入仅 0.042 美元且输出免费 — op7418 · 2026-09-21
- Stefano Ermon 做客 No Priors:扩散 LLM 并行生成是对 scaling 时代的回应 — saranormous · 2026-09-21
- 实测决策模型 Jev:两条 prompt 工程经验与本地 27B 对比 — colinmcnamara · 2026-09-21
- 决策模型 Jev 校准误差约 0.09:对得准但「自信度」仍失真 — colinmcnamara · 2026-09-21
- Jev 单题延迟 143ms:零样本 94% 情感、88% 新闻分类 — colinmcnamara · 2026-09-21
- TypeSafe 发布只做决策不写文本的模型 Jev — colinmcnamara · 2026-09-21