Google 多模态嵌入模型:视觉 token 预算 70 至 1120 可调
tomaarsen · x · 2026-10-07
Google 新多模态嵌入模型细节:视频默认每秒采样 1 帧,音频需为 16 kHz 单声道;每个图像/帧的视觉 soft token 预算可在 70 到 1120 之间配置,token 越多视觉细节越细,但牺牲延迟与上下文容量。配合前一条:所有模态共享 8192 token 上下文窗口。
所属事件:谷歌开源 EmbeddingGemma 2 多模态端侧嵌入模型(27 条相关)→
「多模态」频道最新
- 语音 Agent 的关键在「听起来对」:Turbo 会随用户情绪切换语气 — SucceededMind · 2026-10-07
- Magnific 原创剧集《The Chronicles of Bone》第六集上线,全程 AI 制作 — Kavanthekid · 2026-10-07
- Hedra 上架 ChatGPT 插件:传一张产品图即可生成完整商业广告 — henloitsjoyce · 2026-10-07
- Marc Andreessen 加码:AI 电影大赛 SLOPTOBERFEST 大奖升至2.5万美元 — zealcaiden · 2026-10-07
- 新图像模型定价曝光:2K 每张 0.05 美元,4K 每张 0.076 美元 — op7418 · 2026-10-07
- Flow-GRPO 接入真人投票打分,防图像模型钻奖励模型空子 — lmoroney · 2026-10-07