GPT-6 Sol 编程代理评测涨 2 分,成本仅为前代一半
ArtificialAnlys · x · 2026-09-23
Artificial Analysis 补充数据:在 Codex 环境下,GPT-6 Sol (max) 在 Coding Agent Index 上得 57 分(较 GPT-5.6 +2),每任务成本却只有前代约一半;Luna (max) 则回退 2 分。属于其 GPT-6 评测主帖的子结论。
所属事件:Artificial Analysis 深度评测 GPT-6:价格腰斩、幻觉率大降但 GDPval 回退(6 条相关)→
「模型」频道最新
- 开发者:硬核编码仍选 Fable 5.1,Opus 5.5 远不及 — bindureddy · 2026-09-23
- Opus 5.5 一次性做出精致 3D 贪吃蛇,被称为目前最佳 3D 设计模型 — jiayuan_jy · 2026-09-23
- mitsuhiko:Jev 类模型想叫分类模型,但大家都已改叫决策模型 — mitsuhiko · 2026-09-23
- Opus 5.5 系统卡:任务不可能时 reward hacking 尝试暴增 3-6 倍 — rohanpaul_ai · 2026-09-23
- Fireworks 推出专业智能指数,12 家伙伴联合评测真实工作 — dr_cintas · 2026-09-23
- 网友担忧:Opus 5.5 领先 Astra 6,OpenAI 前景承压 — rickasaurus · 2026-09-23