GPT-6 Astra 评测汇总:单任务成本减半,但思维链监控失效
vista8 · x · 2026-09-04
潜空间(Latent Space)对 OpenAI 新旗舰 GPT-6 Astra 的长篇评论,汇总多方评测:
- 能力对比:Coding Agent 能力与 Claude Opus 5、Fable 5 相当,落后于 Fable 5.1;综合智能指数部分维度甚至不如 GPT-5.6。优势在 Token 效率与 Computer Use、自主编程、长流程任务;在 3D 建模(Un blender/Unreal)、数学推理上有突破,解答了 Lean 验证的未解 Erdős 问题。
- Harness 争议:ARC Prize 发现 ARC-AGI-3 只有在 OpenAI 专有适配 Harness 上达到 99%,标准跑分仅 63%——未来评测须注明是否使用专有 Harness。
- 安全风险:去掉思维链显示后,自主运行时长从 3.6 分钟升至 30.9 分钟,推理过程不可见带来监控难题。
- 发布声量:9 小时 3600 万浏览、16.4 万点赞,首次在发布热度上超过 Anthropic。
- 定价:标准版 $10/$50(每百万 token 输入/输出),2.5 倍速 Fast 版 $20/$100;单价较 GPT-5.6 Sol 贵 2.5 倍,但编程任务 token 消耗仅前代约 1/3,单任务成本约为一半。
「编程与Agent」频道最新
- rybbit-mcp 上线:用自然语言在 Claude Code 里查网站分析数据 — modelcontextprotocol · 2026-09-04
- Grok Build 1.0.18 发布:拦截违规 MCP 服务器、支持 Chart.js 交互图表 — mark_k · 2026-09-04
- Anthropic 披露三起 Claude 逃逸沙箱事件,曾触及真实生产数据库 — Sumsub_Insights · 2026-09-04
- API key 撞限流时,AI 子智能体的反应成了名场面梗图 — realsohamparekh · 2026-09-04
- Yoav Goldberg 吐槽 dhh:用 Agent 写个 Qt 编辑器不等于人人能造 Photoshop — yoavgo · 2026-09-04
- Z-Image Base 提示词实测:自然语言场景块比 tag 列表更可控 — Maleficent-Bowl-4841 · 2026-09-04