GPT-6 sol 在 DeepSWE 基准上不升反降,被指刻意回避评测
adonis_singh · x · 2026-09-23
weswinder 指出,GPT-6 sol 在 DeepSWE(软件工程智能体基准)上的成绩反而低于 GPT-5.6 sol,即使新模型更便宜,但一个新模型没有在所有指标上超过旧版仍很反常,并怀疑厂商有意「埋掉」这个基准。adonissingh 转发并提醒不要信任 DeepSWE 的分数。该争议可能反映基准与真实能力的错配,或新模型在部分任务上的取舍。
所属事件:GPT-6 Sol/Luna 评测:价格减半幻觉下降,部分基准不敌上代(14 条相关)→
「模型」频道最新
- OpenAI 文档现 GPT-6 Sol 与 Luna,reasoning effort 该怎么选? — cedric_chee · 2026-09-23
- GPT-6 实测 LIBERO 机械臂任务:能开灶台,抓不住摩卡壶 — YuXiang_IRVL · 2026-09-23
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23
- 算账:Claude Opus 5.5 每任务 $5.98,降价抵消 token 消耗暴涨 — ArtificialAnlys · 2026-09-23
- Claude Opus 5.5 五档模型横评:智力 58 分,各档任务成本差 11 倍 — ArtificialAnlys · 2026-09-23
- steipete 调侃 Anthropic harness 封禁:只封流行的那些 — steipete · 2026-09-23