Gemma 4 的图像补丁预测可视化
matthen2 · x · 2026-07-19
图里展示了 **Gemma 4 12B** 在一张爱丁堡 *National Galleries of Scotland* 场景图上的 **image patch predictions**:模型会针对不同图像区域给出最显著的下一词预测,例如建筑、标识、人物、天空等局部都会对应不同词汇。 这类可视化更像是在看模型如何“分解”图像并做局部语义联想,而不是单纯的整图分类。作者想强调的是:基础模型在原始图像 patch 级别上的预测,能暴露出它对场景细节的理解方式。
所属事件:Gemma 4图像补丁预测可视化揭示模型机制(4 条相关)→
「多模态」频道最新
- SEEDANCE 2 用电影感提示词生成记忆城市短片 — LudovicCreator · 2026-07-21
- Krea 2 仅凭线稿就能迁移空手道姿势,不用 ControlNet — NatalieCrypto · 2026-07-21
- 商汤在 WAIC 2026 推出 U1 Pro 并开源 5000 万样本视觉数据集 — 机器之心 · 2026-07-21
- 拆解 AI 图像生成:主体、环境与镜头三要素决定画面动态感 — GPU_FieldNotes · 2026-07-21
- MiniCPM-V 4.6 已可在 iPhone 本地运行,无需云端依赖 — amos_gyamfi · 2026-07-21
- 他不再用相机拍摄,而是直接用提示词“出片” — taherdhanera · 2026-07-21