Gemma 4图像补丁预测可视化揭示模型机制

近期多位开发者对Gemma 4 12B多模态大模型在视频和图像处理时的内部机制进行了可视化探索。研究发现,该模型会直接将原始图像补丁作为Token进行读取和预测。通过可视化“下一Token预测”过程,可以直观观察到模型在面对不同图像区域时,能够准确预测出场景、物体、材质和天气等高频词汇。这为理解多模态LLM的视觉认知倾向提供了新视角。

2026-07-19 ~ 2026-07-21 · 4 条相关