GPT-4o 谱图分类已近人类专家水平,两年前就能做到

TuhinChakr · x · 2026-09-10

Chris Donahue 指出,视觉语言模型做音频谱图分类并非新鲜事:在论文《Vision Language Models Are Few-Shot Audio Spectrogram Classifiers》中,GPT-4o 在 10 类谱图分类上拿到 70%,人类专家为 72.5%——这类能力至少两年前就实现了。他自嘲进入科研生涯的「我们几年前就试过了」阶段。

引用背景:Greg Brockman 展示 Astra 做谱图到声音识别的 demo。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →