GPT-5.6 sol被指压制编码与Agent基准
EverydayAI_ · x · 2026-07-12
帖子引用了一段关于模型基准表现的讨论:有人认为 GPT-5.6 sol 在编码和智能体相关 benchmark 上表现“压制性”领先,甚至可能已经达到/超过 Claude Opus 5 的水平。
这条回复进一步延伸了竞争判断:如果这一表现属实,OpenAI 可能会对 Anthropic 形成明显压力;而 Anthropic 需要尽快推出后续版本、延长访问、或调整定价来应对。
所属事件:GPT-5.6 发布引发性能与成本热议(10 条相关)→
「模型」频道最新
- 传 OpenAI 在 Astra 中使用 neuralese 循环变换器,新的 scaling 轴浮出水面 — imadade · 2026-09-03
- XBOW 团队拿下今年首个 Chrome 全链漏洞利用奖励 — moyix · 2026-09-03
- Gemini 3.8 Flash 的 Pareto 最优地位仅维持了 5 小时 18 分钟 — alejandroll10 · 2026-09-03
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Anthropic 商务智能体只建购物车交人工结账,被赞退款风控思路对 — HaktanSuren · 2026-09-03
- Qwen3.8 27B Q8 翻车:12 万 token 后发现根本没读计划,自行实现别的功能 — KingCpzombie · 2026-09-03