Astra 在 10/37 基准上得分超 98%,接近饱和
dswg97 · x · 2026-09-09
评测方指出一个重要警示:Astra 已接近饱和其评测套件,在 37 个基准中的 10 个上得分 ≥98%,相比之下 GPT-5.5 仅饱和 4/37。这导致难以给出可靠的时间视野估计。这也暗示现有评测体系对前沿模型的区分度正在下降。
所属事件:Astra在10项基准得分超98%,评测逼近饱和(2 条相关)→
「模型」频道最新
- 开发者实测吐槽:Astra 体验像「锦上添花的 5.7」,安全任务几乎不可用 — jarrodwatts · 2026-09-11
- GPT-6 Astra 文档引热议:异步工具调用与中途转向或成 Agent 编排利器 — MikkoH · 2026-09-11
- GPT-6 Astra 机器人操作测试 46% 完胜 MolmoAct2 的 12% — damianplayer · 2026-09-11
- OpenAI 发布 GPT-Live 提示词指南:照搬旧提示词难以发挥 SOTA — craigsdennis · 2026-09-11
- 用户吐槽 GPT-6 Astra 一周额度一次用光,周一前无法继续干活 — max_paperclips · 2026-09-11
- Anthropic 宣布 Claude 不再向未成年人开放 — petrusenko_max · 2026-09-11