GPT-4o 谱图分类已近人类专家水平,两年前就能做到
TuhinChakr · x · 2026-09-10
Chris Donahue 指出,视觉语言模型做音频谱图分类并非新鲜事:在论文《Vision Language Models Are Few-Shot Audio Spectrogram Classifiers》中,GPT-4o 在 10 类谱图分类上拿到 70%,人类专家为 72.5%——这类能力至少两年前就实现了。他自嘲进入科研生涯的「我们几年前就试过了」阶段。
引用背景:Greg Brockman 展示 Astra 做谱图到声音识别的 demo。
「模型」频道最新
- Cognition 发布 SWE-2:性能比肩前沿模型,成本最高省 70% — silasalberti · 2026-09-10
- NeoHorse-1-4B 冲上 Hugging Face 热门,主打智能体与工具调用 — TokenRhythm · 2026-09-10
- 国产模型3D夜店实测:DeepSeek V4.1F氛围感碾压 — teortaxesTex · 2026-09-10
- DeepSeek 4.1 Flash现身Boeing榜:成绩未出 — victormustar · 2026-09-10
- Sentry CEO 实测:高阶订阅推理模型表现并不比常规旗舰强 — zeeg · 2026-09-10
- 最新模型已能熟练搞定 ffmpeg 音视频处理任务 — Flomerboy · 2026-09-10