GPT-6 Astra 高分登顶 WeirdML,代码量却显著更少
zainhas · x · 2026-09-05
博主 htihle 的评测显示,GPT-6 Astra(high 档)在 WeirdML 基准上拿到 92.9%,与 Fable 5.1(max 档)并列第一,并在 17 个任务中的 6 个创下新的单项最高分。值得注意的是,Astra 生成的代码量明显少于 Sol 和近期其他 GPT 模型,但仍多于 Claude。博主 zainhas 引用并评论说,考虑到其他基准的表现,high 档已与 Fable 5.1 的 max 档持平,更高档位(xhigh/max)恐怕也难再拉开差距,作者表示等 max/pro max 跑完会做更细致的分析。
所属事件:OpenAI 发布 GPT-6「Astra」,宣告 AGI 时代引发争议与实测热潮(19 条相关)→
「模型」频道最新
- 阿里发布 Qwen-Drive-1.0-4B:4B 视觉语言模型瞄准自动驾驶场景理解 — solyarisoftware · 2026-09-06
- 实测打脸宣传:Astra 着色器生成竟不敌 GLM — teortaxesTex · 2026-09-06
- 曝 GPT-6 Astra 实时画几何,H3 Max 组合做出超快 Blender 渲染器 — jfischoff · 2026-09-06
- 用户抱怨 ChatGPT 近期明显变笨:答非所问还总索要文件 — lonelyroom-eklaghor · 2026-09-06
- 开发者实测 GPT-6 Astra:代码质量与数据分析仅小幅提升 — xeophon · 2026-09-06
- 多家 API 争相低价内卷 DeepSeek-v4-flash,用户几美元烧出海量 token — MaziyarPanahi · 2026-09-06