博主实测 GPT-6 Luna 各档努力度:n=1 即略胜本地 Qwen3.8-27B
PawelHuryn · x · 2026-09-24
Pawel Huryn 分享了所谓 GPT-6 Luna(max)的跑分,n=1 样本下略胜可本地运行的 Qwen3.8-27B,并附上 GPT-6 Sol 各努力度的成绩曲线——图中几乎是一条直线。作者预告接下来会跑 GPT-6 Luna 与 GPT-6 Terra 的 max 档。注意 n=1 样本极小,结果仅供参考。
所属事件:实测:GPT-6 Sol 随算力近线性提升,Bug Hunt 仍不敌 Opus 5.5(3 条相关)→
「模型」频道最新
- 开源多模态决策模型 XOR 发布:基于 Qwen,26 万上下文 — TheMoonMidas · 2026-09-24
- GPT-6 Luna 医疗成绩超上代旗舰,价格便宜约 34 倍 — BorisMPower · 2026-09-24
- 爆论:模型「变笨」或因异构 GPU/TPU 混用推理,质量不一 — michellechen · 2026-09-24
- 网友吐槽:别把消费级产品「Max」式命名套路搬到 LLM 身上 — scaling01 · 2026-09-24
- 罗马团队 Limite 1B 开源,竞赛数学成绩胜过数十倍体量模型 — tensorqt · 2026-09-24
- MentalHealthBench 测评:前沿模型稳步进步,但差距仍明显 — thekaransinghal · 2026-09-24