Gemma 4 12B 视频补丁可视化揭示模型预测倾向
arjunrajlab · x · 2026-07-21
- 这条转发的是一个关于 Gemma 4 12B 的可视化:把原始图像 patch 当作“token”来观察时,模型在看视频帧时会倾向预测什么。
- 作者强调,这并不是模型原本训练目标的一部分;只是借助下一 token 预测头,把多模态模型处理视觉输入的内部倾向“显影”出来。
- 这类图像/视频可视化适合用来理解多模态 LLM 的感知方式和 token 级动态。
所属事件:Gemma 4图像补丁预测可视化揭示模型机制(4 条相关)→
「多模态」频道最新
- Reddit 分享了一支 AI 生成短片《The Lunar Ship》 — Ermajean12 · 2026-07-21
- AI 创作者 GossipGoblin 正在把短视频做成长片 — Hackedv12 · 2026-07-21
- TimeLens2 以 4B 和 8B 模型拿下 7 项视频定位 SOTA — _akhaliq · 2026-07-21
- AI 制作的 4 分钟恐怖短片成了可转发名场面 — gen_ericai · 2026-07-21
- 多款前沿大模型生成红色法拉利 SVG 效果横评 — Able-Line2683 · 2026-07-21
- 给 VLM 加顺序元数据后,错误检测会崩掉 — m_wulfmeier · 2026-07-21