Astra 在 10/37 基准上得分超 98%,接近饱和
dswg97 · x · 2026-09-09
评测方指出一个重要警示:Astra 已接近饱和其评测套件,在 37 个基准中的 10 个上得分 ≥98%,相比之下 GPT-5.5 仅饱和 4/37。这导致难以给出可靠的时间视野估计。这也暗示现有评测体系对前沿模型的区分度正在下降。
所属事件:Astra在10项基准得分超98%,评测逼近饱和(2 条相关)→
「模型」频道最新
- AI Sextet 活动:6 模型 14 天完全免费,含 DeepSeek/Qwen/GLM — airesearch12 · 2026-09-11
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用户呼声下 DeepSeek V4 Pro API 宣布继续服务,计费不变 — teortaxesTex · 2026-09-11