「GPT-6 Luna」疑现性能退化:n=3 时 18.3 分,仅略胜本地 Qwen3.8

PawelHuryn · x · 2026-09-24

Pawel Huryn 发帖称「确认了 GPT-6 Luna (max) 在 n=3 时得分 18.3,性能退化是真的」,并称其 n=1 时的成绩也只比可本地运行的 Qwen3.8-27B 略好。相关消息未经官方证实,真实性存疑,若属实则指向该模型在多次采样/评测场景下存在明显退化问题。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →