Gemma 4 的图像补丁预测可视化

matthen2 · x · 2026-07-19

图里展示了 **Gemma 4 12B** 在一张爱丁堡 *National Galleries of Scotland* 场景图上的 **image patch predictions**:模型会针对不同图像区域给出最显著的下一词预测,例如建筑、标识、人物、天空等局部都会对应不同词汇。 这类可视化更像是在看模型如何“分解”图像并做局部语义联想,而不是单纯的整图分类。作者想强调的是:基础模型在原始图像 patch 级别上的预测,能暴露出它对场景细节的理解方式。

所属事件:Gemma 4图像补丁预测可视化揭示模型机制(4 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →