Meta Spark 1.1基准表现很强
Afinetheorem · x · 2026-07-11
在一个“视觉 + 地理位置 + 知识”基准上,作者称 Meta Spark 1.1 的表现出乎意料地强:
- 仅次于 Gemini 3.x 系列 和 Fable
- 甚至超过了作者测试过的所有 OpenAI、Grok 和中文模型
- 这个任务要求把地点映射到经纬度,属于较难的视觉地理推理
作者还补充说,用“10 英里内命中”作为标准,是因为相机焦距等因素让精确定位在部分样本里几乎不可能。
「模型」频道最新
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11
- Terminal Bench v4 榜单:GLM-5.3 以 41.9% 一骑绝尘 — Ok_Warning2146 · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11