多模态语音能力仍被低估
emollick · x · 2026-07-14
作者认为,图像输入可能是当前模型最重要的能力之一,而工具调用在一定程度上可以替代“非 omni 模型”的部分输出能力。相比之下,多模态语音能力似乎还没有被充分挖掘,至少目前主要还是 OpenAI 在推动。
回复里也提到一个观察:真正的“任意输入-任意输出”的完整多模态模型并没有成为更大的行业焦点。Google 是少数持续发布这类模型的实验室;OpenAI 走的是选择性多模态路线;Anthropic 一直没有多模态输出;开源权重模型的表现则参差不齐。
所属事件:行业探讨全模态模型为何未能成为主流(3 条相关)→
「模型」频道最新
- AI Sextet 活动:6 模型 14 天完全免费,含 DeepSeek/Qwen/GLM — airesearch12 · 2026-09-11
- Anthropic 发布迄今最详尽威胁情报报告:无人机蜂群滥用案例曝光 — soumitrashukla9 · 2026-09-11
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11