实测称 GPT-6 视觉能力倒退,提取成绩暴跌 15 个百分点
ducha_aiki · x · 2026-09-24
开发者 skalskip92 发布对比数据,称 "GPT-6 Luna" 在视觉任务上整体弱于 "GPT-5.6 Luna":高难度档位下,文本提取从 81.79% 跌至 66.67%,计数从 70.72% 跌至 64.41%,推理从 65.56% 跌至 60.71%;唯一提升的是目标检测,从 62.29% 升至 64.12%。作者附上多组失败示例与完整评测链接,结论是新版本在视觉理解上出现明显退化。
「模型」频道最新
- ChatGPT 语音可调用插件并接入 GPT-6 三款模型,全球推送 — romainhuet · 2026-09-24
- GPT-6 Luna 医疗成绩超上代旗舰,价格便宜约 34 倍 — BorisMPower · 2026-09-24
- 爆论:模型「变笨」或因异构 GPU/TPU 混用推理,质量不一 — michellechen · 2026-09-24
- 网友吐槽:别把消费级产品「Max」式命名套路搬到 LLM 身上 — scaling01 · 2026-09-24
- 罗马团队 Limite 1B 开源,竞赛数学成绩胜过数十倍体量模型 — tensorqt · 2026-09-24
- MentalHealthBench 测评:前沿模型稳步进步,但差距仍明显 — thekaransinghal · 2026-09-24