棉花糖基准:测试 AI 数图能力的有趣实验

qu1etus · reddit · 2026-08-21

作者创建了「Marshmallow Benchmark(棉花糖基准)」:在烤盘上铺满棉花糖拍照,要求 AI 准确计数。虽然提示词明确要求观察而非猜测,但各主流模型(Gemini、Claude、GPT 等)的回复结果从 472 到 539 不等,差异显著。这是一个展示多模态模型在细节计数和幻觉问题上表现的趣味测试。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →