GPT 6 Luna 视觉推理翻车,被评两年内最差西方模型

Afinetheorem · x · 2026-09-25

Andon Labs 发布新一轮 Blueprint-Bench 评测:GPT 6 Sol 略优于 5.6 Sol,Grok 4.7 略差于 4.6,而 GPT 6 Luna 表现很差。评测者指出 Luna 在视觉推理上出了大问题,几乎看不到图像细节,是他两年测过的最差的西方模型;同批的 Sol 表现尚可但仍明显落后 Astra,而 Opus 5.5 被评为「出色」。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →