Gemma 4 看视频时在预测什么
matthen2 · x · 2026-07-19
作者在问:多模态 LLM 看视频时,到底“在想什么”? 这里提到 Gemma 4 12B 会直接读取原始图像 patch,像 token 一样处理;虽然它并没有被训练去在这些“patch token”上做预测,但视频展示了:如果强行从它的 next-token head 采样,会得到怎样的下一步预测结果。这个帖子更像是在展示多模态模型内部表示与预测机制,而不是普通的产品介绍。
所属事件:Gemma 4 图像补丁预测能力可视化(3 条相关)→
「多模态」频道最新
- 纸雕风图像提示词模板 — azed_ai · 2026-07-20
- Midjourney 和 Seedance 动效作品 — Swimming-Tooth2422 · 2026-07-20
- 用 AI 伪造体育直播画面 — techhalla · 2026-07-20
- 商汤U1 Pro主打交付级生图 — KevinNaughtonJr · 2026-07-20
- Seedance 领跑 AI 电影制作 — taherdhanera · 2026-07-20
- ComfyUI里怎么给Anima Turbo做放大 — SILVER5893 · 2026-07-20