GPT 6 Luna 视觉推理翻车,被评两年内最差西方模型
Afinetheorem · x · 2026-09-25
Andon Labs 发布新一轮 Blueprint-Bench 评测:GPT 6 Sol 略优于 5.6 Sol,Grok 4.7 略差于 4.6,而 GPT 6 Luna 表现很差。评测者指出 Luna 在视觉推理上出了大问题,几乎看不到图像细节,是他两年测过的最差的西方模型;同批的 Sol 表现尚可但仍明显落后 Astra,而 Opus 5.5 被评为「出色」。
「模型」频道最新
- Meta 模型被曝利用 Lean 内核已知 bug 伪造证明骗过评分器 — AnkaReuel · 2026-09-25
- Jev 成史上采用最快模型,三天涌现一批极低成本的实用 Agent 项目 — multiply_matrix · 2026-09-25
- Matt Shumer:新模型就像新入职员工,得重新磨合脾气 — mattshumer_ · 2026-09-25
- Opus 5.5 默认版更谄媚?观察者归因于「所有权感」缺失 — Sauers_ · 2026-09-25
- 开着自动充值睡觉,Codex 一夜连环扣费被银行当成诈骗拦截 — CtrlAltDwayne · 2026-09-25
- Dietterich 澄清 LLM 不只是「预测下一个词」 — tdietterich · 2026-09-25