Gemma 4 12B 视频补丁可视化揭示模型预测倾向
arjunrajlab · x · 2026-07-21
- 这条转发的是一个关于 Gemma 4 12B 的可视化:把原始图像 patch 当作“token”来观察时,模型在看视频帧时会倾向预测什么。
- 作者强调,这并不是模型原本训练目标的一部分;只是借助下一 token 预测头,把多模态模型处理视觉输入的内部倾向“显影”出来。
- 这类图像/视频可视化适合用来理解多模态 LLM 的感知方式和 token 级动态。
所属事件:Gemma 4图像补丁预测可视化揭示模型机制(4 条相关)→
「多模态」频道最新
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11
- ComfyUI 新节点发现器上线:按 star 增速过滤最新热门节点 — Luke2642 · 2026-09-11