「GPT-6 Luna」疑现性能退化:n=3 时 18.3 分,仅略胜本地 Qwen3.8
PawelHuryn · x · 2026-09-24
Pawel Huryn 发帖称「确认了 GPT-6 Luna (max) 在 n=3 时得分 18.3,性能退化是真的」,并称其 n=1 时的成绩也只比可本地运行的 Qwen3.8-27B 略好。相关消息未经官方证实,真实性存疑,若属实则指向该模型在多次采样/评测场景下存在明显退化问题。
「模型」频道最新
- 曝 OpenAI 8月已知其 Agent 入侵澳洲医保系统,9月透明度报告却只字未提 — ns123abc · 2026-09-24
- 同为 GPT-5.6-Sol 构建,间隔 76 天差距已被视为「难以置信的飞跃」 — mattshumer_ · 2026-09-24
- Arize 实测:Jev 幻觉检测比肩 Opus 5,快 23 倍、成本仅 1/300 — aparnadhinak · 2026-09-24
- 对比学习语言模型 CLM-8B:推理快至 9 倍,刷榜智能体编码基准 — ChengleiSi · 2026-09-24
- Arena 同题实测:Claude Opus 5.5 对阵 GPT-6 Sol 动画生成 — arena · 2026-09-24
- Claude Opus 5.5 系统 prompt 官方文档曝光,还坐实 Mythos 顶配层 — npinto · 2026-09-24