GPT-6 Sol 在 DeepSWE 上反输前代:72.7% 对 68.8%
banaxi-tech · reddit · 2026-09-23
Reddit 用户对比了 GPT-6 Sol 与 GPT-5.6 Max 在 DeepSWE 基准上的表现:GPT-5.6 Max 得分 72.7%,而新一代 GPT-6 Sol 只有 68.8%,新版反而落后近 4 个百分点。这与不少用户反馈 GPT-6 Sol 非编码任务表现不佳、思考深度不足的现象相互印证,引发对新一代模型能力取舍的讨论。
「模型」频道最新
- DiffusionGemma-Jev 合入 vLLM:一步去噪读出答案置信度 — bodonoghue85 · 2026-09-23
- Muse Spark 1.3 实测:价格香,写数学证明还不行 — tianyin_xu · 2026-09-23
- 悬赏千元挑战:Afinetheorem 无人找到法语 AI 小说误判实例 — birchlse · 2026-09-23
- HF 工程师提议:决策模型应自动按任务分配推理算力 — mishig25 · 2026-09-23
- 曝 OpenAI 平台将推出 Free/Prototype/Accelerate 三档开发者套餐 — testingcatalog · 2026-09-23
- JevBench 冲上 HN 首页,质疑者指 Jev 疑似套壳 Qwen — airesearch12 · 2026-09-23