图像计数实测:Gemini 与 GPT 均翻车
bytebot · x · 2026-08-18
测试了 Gemini 3.7 Flash 和 GPT-5.6 Sol High 在图像计数任务(如彩色哑铃堆)上的表现,结果两者都答错了。发现通过要求模型“验证”答案可以逐步修正,但整体效率仍不如人工直接计数。
「模型」频道最新
- Hugging Face开源模型突破300万,社区加速开放 — multimodalart · 2026-08-18
- 学者提醒:应假设所有公开基准测试都在撒谎 — yacineMTB · 2026-08-18
- 用户发现 Anthropic 疑似取消 Fable 每周 50% 用量上限 — legit_api · 2026-08-18
- Anthropic token 单价达 Vercel 均价 4.4 倍,开发者仍愿买单 — The Decoder · 2026-08-18
- 求推荐前 10 名中拒绝率低、不废话的 LLM — nobodyreadusernames · 2026-08-18
- 观点:DeepSeek 应放弃 4.1 转向更大规模预训练 — zephyr_z9 · 2026-08-18