Gemma 4 看视频时在预测什么

matthen2 · x · 2026-07-19

作者在问:多模态 LLM 看视频时,到底“在想什么”? 这里提到 Gemma 4 12B 会直接读取原始图像 patch,像 token 一样处理;虽然它并没有被训练去在这些“patch token”上做预测,但视频展示了:如果强行从它的 next-token head 采样,会得到怎样的下一步预测结果。这个帖子更像是在展示多模态模型内部表示与预测机制,而不是普通的产品介绍。

所属事件:Gemma 4 图像补丁预测能力可视化(3 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →