实测多模态大模型玩地理盲猜:速度不及人类专家
HanchungLee · x · 2026-08-04
开发者测试了多个多模态大模型在地理盲猜任务上的表现。此前 Gemini 和其他模型因被地名误导而严重翻车。最新测试显示,5.6 版本的模型在结合两次地理定位和浏览器控制后,耗时 10 分钟成功解题,展现出强大的多模态推理与工具调用能力,但速度仍远逊于能在 3 分钟内完成的人类专家。
「模型」频道最新
- 企业级AI部署痛点:模型切换成本远超性能差距 — sanjaykalra · 2026-08-04
- 疑似 OpenAI 新图模 Luffa V4 曝光,文字与细节生成惊艳 — mark_k · 2026-08-04
- 阿里 Qwen 无人值守自主编程 10 天:能提 Issue 也能自修 Bug — Due-Cup9574 · 2026-08-04
- ChatGPT Plus 还值得买吗?网友热议转投 Kimi 等国产大模型 — Sure_Artichoke6929 · 2026-08-04
- 原生工具调用与采样参数修正,可大幅提升模型评测分数 — xeophon · 2026-08-04
- MiniMax H3 澄清商业授权:明确美欧英韩等地合规细节 — Better-Interview-793 · 2026-08-04