图像计数实测:Gemini 与 GPT 均翻车

bytebot · x · 2026-08-18

测试了 Gemini 3.7 Flash 和 GPT-5.6 Sol High 在图像计数任务(如彩色哑铃堆)上的表现,结果两者都答错了。发现通过要求模型“验证”答案可以逐步修正,但整体效率仍不如人工直接计数。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →