GPT 5.6 Sol 在某项基准上被标出 72.7% 的更高成绩
himanshustwts · x · 2026-07-25
- 这条帖子说前面的讨论漏掉了重点,现在要指出 GPT 5.6 Sol 表现更好的地方。
- 附图是一个基准表格,红圈标出了 Agentic coding / DeepSWE v1.1 这一行的 72.7%。
- 本质上是一条模型对比帖,重点在于不同系统在特定任务上的成绩差异。
「模型」频道最新
- Opus 5 的空间感知能力被评价很强 — almmaasoglu · 2026-07-25
- 艺术家宣布:与 AI 协作作品将署名“AI-generated” — Merzmensch · 2026-07-25
- Perplexity 为 Pro 和 Max 用户接入 Opus 5,价格约减半 — AravSrinivas · 2026-07-25
- Anthropic 新模型 Opus 5 曝光:任务耗时与轮次远超 Opus 4.8 — ArtificialAnlys · 2026-07-25
- Claude Opus 5 登顶 AA-Briefcase,单任务成本还降了 20% — ArtificialAnlys · 2026-07-25
- GPT-5.6 Sol 打 Act 3 A7 boss 看起来要赢了 — Jsevillamol · 2026-07-25