GPT-6 Luna 多项基准不敌上代 5.6?综合打平但价格大降
DataLearnerAI · reddit · 2026-09-23
DataLearnerAI 在更新 GPT-6 Luna 基准数据时发现意外情况:在不少已报告的基准上,GPT-5.6 Luna 的得分反而高于 GPT-6 Luna。核对 Artificial Analysis 后,两代模型在最高推理档位下的整体智能指数基本打平(37 vs 37)。
分项结果则互有胜负:GPT-6 Luna 在部分 agent/编码任务上有提升,但 5.6 在另一些任务上仍更强。最明显的进步是效率——GPT-6 Luna 显著更便宜。
作者因此猜测 GPT-6 Luna 或许是有意做成本/速度优化,而非相对 5.6 的纯能力升级;也可能是不同评测 harness 和推理设置导致对比不完全公平。他想听听大家在真实使用中的感受。
「模型」频道最新
- 用户称 Opus 5.5 是 4.6 以来最大升级,担忧高量化版先发再降智 — haider1 · 2026-09-23
- 开源追上闭源?ARK 分析师:前沿实验室内部迭代反可拉大差距 — skorusARK · 2026-09-23
- Rails Agent 评测:OpenAI 保持领先,黑马 Luna Max 11 美元拿下 18% 完成率 — npew · 2026-09-23
- Pangram v4 把 2020 年前的数千行长文判成 100% AI 生成 — birchlse · 2026-09-23
- 手机上看 Artificial Analysis 模型发布曲线:陡峭得像指数预测图 — StrategicHarmony · 2026-09-23
- GPT-6 Luna/Sol 网络安全实测:Sol 重现 68.8% CVE,单价大降 — rickasaurus · 2026-09-23