GPT-6 Sol/Luna 评测汇总:更便宜幻觉更少但未全面超越上代

GPT-6 Sol 与 Luna 发布后,Artificial Analysis 将两款模型纳入 Intelligence Index v4.3 横评并发布系列深度数据;同时多位用户实测称 GPT-6 Sol 在部分复杂任务上不敌上代 GPT-5.6 Sol,Every 团队则给出偏正面的日常使用评价。整体图景是:新模型更便宜、更高效、幻觉更少,但并非全面超越前代,在软件工程与知识工作评测上出现回退。

已确认

尚未确认

为什么重要

新模型未在所有指标上超过旧版较为反常,引发对模型代际进步是否放缓、厂商选择性披露评测的讨论;同时价格腰斩叠加幻觉率大幅下降,对成本敏感的生产场景仍有明显吸引力。第三方基准、用户实测与日常使用评价(如 Every 的正面结论)方向不完全一致,提示按自身任务负载实测选型比迷信「新一代」更重要。

2026-09-23 ~ 2026-09-23 · 13 条相关

一手来源