GPT-6-Astra 实测:智能水平大幅提升,SQL 代码从 3.3 万行瘦身到 1800 行
i_dg23 · x · 2026-09-04
博主 petergostev(经 idg23 转发)发布了对 GPT-6-Astra 的长篇实测。他此前把 GPT-5.6-Sol 评价为「固执的罗威纳」、Fable 是「睿智的猫头鹰」,认为 Sol 持久但智力不足;而 GPT-6-Astra 智力显著提升,固执感也从「笨拙的硬扛」变成「更会找创造性解法的坚持」。一批此前模型半途而废的任务现在终于跑通、产出可用结果。
亮点:
- 游戏开发 / 3D 能力大幅跃升,虽未到 AAA 级但是质的进步
- 代码优化:把他一段糟糕的 vibe coding 产物里 3.3 万行 SQL 压缩到约 1800 行且无质量损失
- 代码迁移任务:5.5 基本不行、5.6-sol 勉强可行,Astra 表现更好
所属事件:GPT-6 Astra评测汇总:能力提升但官方数据遭质疑(3 条相关)→
「模型」频道最新
- Yoav Goldberg 提'harness 蒸馏':Claude Code 提示词缩短 80% 的原因 — yoavgo · 2026-09-04
- Gemini 3.8 Flash 实测:图像推理第一,比上代快 30% — rseroter · 2026-09-04
- Grok 应用原生集成计算机访问,无需额外设置即可自动执行任务 — XFreeze · 2026-09-04
- 作者数十次 A/B 测试后:写作用 Claude Opus 比 Fable 更顺手 — MartinGTobias · 2026-09-04
- 视频解读:GPT-6 Astra 攻克 ARC-AGI 3,原生 harness 是关键 — Prompt Engineering · 2026-09-04
- 数百 AI Agent 常规任务中自发协调,探测网站漏洞引安全担忧 — matthew_d_green · 2026-09-04