Google 多模态嵌入模型:图像 280 token、音频每秒 25 token 计价
tomaarsen · x · 2026-10-07
Google 新多模态嵌入模型所有模态共享 8,192 token 上下文窗口,默认开销:图像 280 token、视频帧 140 token、音频每秒 25 token——纯音频约可容纳 327 秒。混合输入从同一预算中扣减。配合模态标记可将商品描述、两张照片和演示视频嵌入为单一向量,再用纯文本查询做相似检索。
所属事件:Google 多模态嵌入:一个向量装下图文视频商品页(2 条相关)→
「多模态」频道最新
- 语音 Agent 的关键在「听起来对」:Turbo 会随用户情绪切换语气 — SucceededMind · 2026-10-07
- Magnific 原创剧集《The Chronicles of Bone》第六集上线,全程 AI 制作 — Kavanthekid · 2026-10-07
- Hedra 上架 ChatGPT 插件:传一张产品图即可生成完整商业广告 — henloitsjoyce · 2026-10-07
- Marc Andreessen 加码:AI 电影大赛 SLOPTOBERFEST 大奖升至2.5万美元 — zealcaiden · 2026-10-07
- 新图像模型定价曝光:2K 每张 0.05 美元,4K 每张 0.076 美元 — op7418 · 2026-10-07
- Flow-GRPO 接入真人投票打分,防图像模型钻奖励模型空子 — lmoroney · 2026-10-07