实测GPT-6 Astra:agentic提升显著,ARC-AGI-3成绩极度依赖测试框架
No-Soil-5789 · reddit · 2026-10-01
作者对比了 GPT-6 Astra 与 GPT-5.6 Sol、Claude Fable 5.1:
- 学术推理类提升有限:DeepSWE v1.1 得 74.1%、GPQA Diamond 得 96%,但与对手差距不大,单轮任务升级未必值回成本。
- 多步交互执行大幅领先:Terminal-Bench 4.0 拿下 57.9%(Sol 仅 37.3%);OSWorld 2.0 成功率 72.6%,平均任务时间从一小时以上降到约 40 分钟,明显针对长时程工具调用与数据库迁移优化。
- 超长上下文稳定:MRCR v2 检索测试中,512K–1M token 区间仍保持 96.3% 检索率,1.05M 上下文没有崩。
- ARC-AGI-3 对测试框架极度敏感:中立框架下开满 effort 仅 62.7%,换用带状态持久化的 Provider Adapter 后飙到 99.9%,且 token 消耗几乎减半——跑分可信度存疑。
工程方面,标准费率只覆盖到 272K 输入 token,更长就触发长上下文加价;作者用 OpenAI 兼容网关(CometAPI,LiteLLM 也可)统一调用 OpenAI 与 Anthropic 控制成本。
「编程与Agent」频道最新
- Ethan Mollick 自认误判:AI 智能体已能自组织协作,无需人工编排 — emollick · 2026-10-01
- RegLLM 诊断框架:测受监管 Agentic AI 的有界自主性 — Dipankar Sarkar · 2026-10-01
- 开源多智能体工作台 Jelly 发布:为单机跑整个业务而生 — Scobleizer · 2026-10-01
- Claude 已能直接操作 Blender:独立完成从概念到低模的角色流水线 — tobowers · 2026-10-01
- Agent 90 分钟跑 322 个 HF Jobs 测代码,账单仅 $4 — vanstriendaniel · 2026-10-01
- 投资人总结 AI 尽调三问:业务逻辑在哪、权限怎么管、单次成本多少 — julsimon · 2026-10-01