Google 多模态嵌入模型:视觉 token 预算 70 至 1120 可调

tomaarsen · x · 2026-10-07

Google 新多模态嵌入模型细节:视频默认每秒采样 1 帧,音频需为 16 kHz 单声道;每个图像/帧的视觉 soft token 预算可在 70 到 1120 之间配置,token 越多视觉细节越细,但牺牲延迟与上下文容量。配合前一条:所有模态共享 8192 token 上下文窗口。

所属事件:谷歌开源 EmbeddingGemma 2 多模态端侧嵌入模型(27 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →