Astra 在 37 项基准中 10 项达 98%,时间 horizon 估算逼近饱和
dswg97 · x · 2026-09-09
作者介绍其时间 horizon(TH)估算方法:注入 0% 成功率的合成长时程(>2 小时)任务,再筛选成功率方差显著的 bootstrap 样本,以得到更合理的 TH 估计。
关键警示:Astra 已接近在其评测套件上饱和——37 项基准中有 10 项达到 ≥98%,而 GPT-5.5 仅饱和 4/37,因此对 Astra 给出可信的时间 horizon 估计已很困难。
所属事件:Astra在10项基准得分超98%,评测逼近饱和(2 条相关)→
「模型」频道最新
- Similarweb:ChatGPT 月活破 10.6 亿,连续 4 个月创新高 — FinanceYF5 · 2026-09-11
- PuzzleMask 用普通英文绕过全部 4 个 LLM 门卫模型 — TechNadu · 2026-09-11
- 曝 OpenAI Codex 或于本周末再发额度重置,Codex 负责人暗指常有 — umesh_ai · 2026-09-11
- 曝 OpenAI 用 Navier-Stokes 模型攻黎曼猜想与 P vs NP — 141_1337 · 2026-09-11
- 实测发现 OpenRouter 不稳定支持 Meta Muse effort 档位,欧盟付费也受阻 — PawelHuryn · 2026-09-11
- 用户实测:Codex 单轮烧掉 4700 积分,$200 额度 20 分钟未完成任务 — RileyRalmuto · 2026-09-11