Google 多模态嵌入模型:图像 280 token、音频每秒 25 token 计价

tomaarsen · x · 2026-10-07

Google 新多模态嵌入模型所有模态共享 8,192 token 上下文窗口,默认开销:图像 280 token、视频帧 140 token、音频每秒 25 token——纯音频约可容纳 327 秒。混合输入从同一预算中扣减。配合模态标记可将商品描述、两张照片和演示视频嵌入为单一向量,再用纯文本查询做相似检索。

所属事件:Google 多模态嵌入:一个向量装下图文视频商品页(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →