Astra在10项基准得分超98%,评测逼近饱和

针对 Google Astra 模型的评测显示,其在37项基准中的10项上得分达到或超过98%,相比之下 GPT-5.5 仅饱和4项,说明Astra已接近饱和其评测套件。评测方还介绍了时间horizon估算方法:通过注入0%成功率的合成长时程(超过2小时)任务并筛选成功率方差显著的bootstrap样本来获得更合理的估计,但基准饱和使可靠的时间horizon评估变得困难。

2026-09-09 ~ 2026-09-09 · 2 条相关