GPT-6 Astra 一举推高 Epoch 能力指数 6 分,FrontierMath Tier 4 达 98% 饱和
eyishazyer · x · 2026-09-06
推主 eyishazyer 发布长线程分析 GPT-6 Astra 发布带来的影响:
- 能力指数跳升:Epoch AI 能力指数从 163 升至 169。推理时代以来年均增幅约 15 分,这次单次发布带来 6 分,相当于约 5 个月的进展一夜之间兑现。
- 单项成绩:Mystery Game Puzzles 84%(此前最高 59%);FrontierMath Tier 4 达 98%,Epoch 宣布该档已完全饱和。
- 指数分歧:Artificial Analysis 的综合指数并未把 Astra 排在第一——其权重更偏 agent 和编码。两个指数结论相反但都成立,说明单一榜单不足以判断模型位置。
- 定价与限额:Astra medium 以约 1/3 的成本提供接近 5.6 xhigh 的智能水平,性价比是最大亮点。OpenAI 还悄悄上调了所有套餐的 5 小时速率限制,未发公告,从测试到全量上线不到一天。
- 口碑与内幕:各方反应几乎全是正面,推主自测数小时也表示认可。另有未经证实的消息称 Astra 内部使用促使 OpenAI 把原定明年中的部分路线图提前到 DevDay 发布。
所属事件:GPT-6 Astra刷新Epoch能力指数纪录(3 条相关)→
「模型」频道最新
- 用户吐槽:Opus 4.8 写界面惊艳,OpenAI 模型却缺一个日常编码工具定位 — aloncarmel · 2026-09-07
- 荷兰格罗宁根基于 Qwen 3.5 27B 微调建本土 AI,数据中心获补贴 — teortaxesTex · 2026-09-07
- Bindu Reddy:DeepSeek 能干 80% 日常任务且便宜 100 倍 — bindureddy · 2026-09-07
- 用户 Astra 发布当天即遭封禁,申诉无门引透明度争议 — QuixiAI · 2026-09-07
- Naval 用学骑自行车类比 SFT 与 RL:DeepSeek 展示智能可被生长 — McDonaghMatthew · 2026-09-07
- DeepSeek-R1 用纯 RL 种出推理能力,作者称人类发展轨迹被改变 — McDonaghMatthew · 2026-09-07