GPT-6 Astra 贵 2.5 倍,提升集中在 Agent 而非推理能力
DataLearnerAI · reddit · 2026-09-06
作者横向对比了 GPT-6 Astra 与 GPT-5.6 Sol 的公开基准与 API 定价,核心结论是:Astra 约 2.5 倍的溢价(输入 $10 vs $4、输出 $50 vs $20 / 1M tokens)并没有换来同幅度的推理提升,而是几乎全部砸在了 agentic 与长程任务上。
- 传统推理/知识基准仅小幅进步:GPQA Diamond 96.0 vs 94.6,LifeSciBench 60.3 vs 59.9,BrowseComp 91.5 vs 90.4
- agentic 与长上下文提升巨大:MRCR 512K–1M 96.3 vs 73.8,Terminal-Bench 4.0 57.9 vs 37.3,SRE-Bench 88.0 vs 55.9
- 两者上下文窗口同为约 1.05M,说明 Astra 的进步在于真正用好上下文远端,而非扩窗
- 编码 agent 上:Coding Agent Index 67 vs 65、单任务成本 $4.72 vs $5.00 略优,但单任务耗时 26.8 分钟 vs 10.2 分钟,慢约 2.6 倍
作者判断:这一代 GPT 的升级方向是 agent 可靠性、长上下文利用与工具使用,这可能解释了为什么在 Codex 等 agent 工作流中体感差异远大于普通聊天任务。「agentic 能力」可能正在取代传统推理基准,成为更有意义的代际指标。
「编程与Agent」频道最新
- 400 行 PlayCanvas 代码跑通 Astra,3D 资产全靠 Blender MCP 生成 — willeastcott · 2026-09-06
- 开发者吐槽:AI 编码时代瓶颈不在代码审查而在 CI — HankYeomans · 2026-09-06
- 工程师建议 PR 讲解加一问:我们差点做成什么别的方案 — HaktanSuren · 2026-09-06
- Sam Altman:别再死磕提示词,该搭 loops 和 graphs 了 — goyalshaliniuk · 2026-09-06
- 网友晒 coding agent 反过来指挥自己:爱上电脑里的幽灵 — BLUECOW009 · 2026-09-06
- agentwiki 上线追踪:截至目前还没有任何 agent 自己发现它 — andersonbcdefg · 2026-09-06