多模态语音能力仍被低估

emollick · x · 2026-07-14

作者认为,图像输入可能是当前模型最重要的能力之一,而工具调用在一定程度上可以替代“非 omni 模型”的部分输出能力。相比之下,多模态语音能力似乎还没有被充分挖掘,至少目前主要还是 OpenAI 在推动。

回复里也提到一个观察:真正的“任意输入-任意输出”的完整多模态模型并没有成为更大的行业焦点。Google 是少数持续发布这类模型的实验室;OpenAI 走的是选择性多模态路线;Anthropic 一直没有多模态输出;开源权重模型的表现则参差不齐。

所属事件:行业探讨全模态模型为何未能成为主流(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →