棉花糖基准:测试 AI 数图能力的有趣实验
qu1etus · reddit · 2026-08-21
作者创建了「Marshmallow Benchmark(棉花糖基准)」:在烤盘上铺满棉花糖拍照,要求 AI 准确计数。虽然提示词明确要求观察而非猜测,但各主流模型(Gemini、Claude、GPT 等)的回复结果从 472 到 539 不等,差异显著。这是一个展示多模态模型在细节计数和幻觉问题上表现的趣味测试。
「多模态」频道最新
- LTX-2.3-10Eros_I2V 登顶 Hugging Face 热榜 — amisima · 2026-08-21
- 腾讯 WithEveryone 实现多人身份保持图像生成 — Tencent-Hunyuan · 2026-08-21
- 如何让Minimax H3生成视频时去除背景音乐? — Early-Reputation3186 · 2026-08-21
- Minimax H3生成惊艳视频,网友惊叹 — Eric520CC · 2026-08-21
- Depth Anything V4:黎曼流匹配重建4D场景,无效高斯降至0.01% — RexDouglass · 2026-08-21
- MeanVC2:实时语音转换模型,支持跨性别跨语言 — Acceptable-Cycle4645 · 2026-08-21