Gemma 4 12B 图像补丁预测
matthen2 · x · 2026-07-19
这张图展示了 **Gemma 4 12B** 在图像 patch 级别上的“下一 token 预测”可视化:不同图像区域会对应不同的高频预测词,说明模型对场景、物体、材质、天气、方位等信息有明显的局部偏好。 图中把这些预测词直接叠在原图上,能看到模型会在建筑、道路、车辆、人物等区域产生各自不同的语义联想。整体更像是一种多模态模型内部表征的观察图,而不是普通生成结果。
所属事件:Gemma 4图像补丁预测可视化揭示模型机制(4 条相关)→
「多模态」频道最新
- SEEDANCE 2 用电影感提示词生成记忆城市短片 — LudovicCreator · 2026-07-21
- Krea 2 仅凭线稿就能迁移空手道姿势,不用 ControlNet — NatalieCrypto · 2026-07-21
- 商汤在 WAIC 2026 推出 U1 Pro 并开源 5000 万样本视觉数据集 — 机器之心 · 2026-07-21
- 拆解 AI 图像生成:主体、环境与镜头三要素决定画面动态感 — GPU_FieldNotes · 2026-07-21
- MiniCPM-V 4.6 已可在 iPhone 本地运行,无需云端依赖 — amos_gyamfi · 2026-07-21
- 他不再用相机拍摄,而是直接用提示词“出片” — taherdhanera · 2026-07-21