GPT-6 sol 在 DeepSWE 基准上不升反降,被指刻意回避评测

adonis_singh · x · 2026-09-23

weswinder 指出,GPT-6 sol 在 DeepSWE(软件工程智能体基准)上的成绩反而低于 GPT-5.6 sol,即使新模型更便宜,但一个新模型没有在所有指标上超过旧版仍很反常,并怀疑厂商有意「埋掉」这个基准。adonissingh 转发并提醒不要信任 DeepSWE 的分数。该争议可能反映基准与真实能力的错配,或新模型在部分任务上的取舍。

所属事件:GPT-6 Sol/Luna 评测:价格减半幻觉下降,部分基准不敌上代(14 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →