Gemma 4 看视频时在预测什么
matthen2 · x · 2026-07-19
作者在问:多模态 LLM 看视频时,到底“在想什么”?
这里提到 Gemma 4 12B 会直接读取原始图像 patch,像 token 一样处理;虽然它并没有被训练去在这些“patch token”上做预测,但视频展示了:如果强行从它的 next-token head 采样,会得到怎样的下一步预测结果。这个帖子更像是在展示多模态模型内部表示与预测机制,而不是普通的产品介绍。
所属事件:Gemma 4图像补丁预测可视化揭示模型机制(4 条相关)→
「多模态」频道最新
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- AI 电影节 Lumara 将登陆纽约,顶级 AI 电影人齐聚评审 — 0xAllen_ · 2026-09-11
- 翼龙侦探:全程 AI 生成的概念片先导预告亮相 — PterodactylDetective · 2026-09-11
- Imperium 游戏预告片曝光,AI 视频生成再秀肌肉 — keaslenyt · 2026-09-11
- FLUX.2 Klein 换表情易丢脸,实测不如免费版 Gemini 保真 — wacomlover · 2026-09-11
- 腾讯 AuK 语音模型开源代码与权重上线 GitHub,附 ComfyUI 支持 — aigclink · 2026-09-11