实测 Gemini 当音乐理解模型:Pro 3.1 靠谱,Flash 幻听严重
teropa · x · 2026-09-07
teropa 分享了用 Gemini 模型做音乐理解的实测结果:Gemini Pro 3.1 在识别乐器、曲风、人声有无方面表现不错;而 Flash 系(2.5 和 3.8)存在大量幻听式误报,倾向于给所有音乐加「合成器 pad」,2.5 还爱到处安插鼓点。更有意思的是,加大 thinking 反而让 Flash 更差——更多思考空间只是给了它更多编造的余地。作者推断瓶颈出在感知层,可能与音频 tokenization 有关。
「模型」频道最新
- 数学家指责 OpenAI Astra 十项数学成果涉研究不端:未引用已有文献 — asusarla · 2026-09-07
- OpenAI 新模型在旧 Chat Completions 接口禁用 function tools,迁移二选一 — AI-Specialist-6597 · 2026-09-07
- 开发者实测:Astra 擅长自主目标推进,指令遵循却不及 Sol — MinqiJiang · 2026-09-07
- 美国政府正以 1 美元价格使用三大模型,合同本月到期存续未知 — LuizaJarovsky · 2026-09-07
- SimpleBench 成绩显示 AI 常识推理超过人类 — DigSignificant1419 · 2026-09-07
- 腾讯 Hy4 成 OpenRouter 用量最高模型,却几乎无人讨论 — cantor8 · 2026-09-07