新研究定位 VLM 中负责 OCR 的注意力头,竟能读出图像全部语义

gsarti_ · x · 2026-09-29

研究者 Sheridan Feucht 发布新预印本,探讨视觉语言模型中图像与词语的对齐机制。团队找到一组专门负责 OCR 的注意力头,但意外发现这些头能「口述」的远不止画面中的文字——还能读出图像的更多语义信息。基于这一发现,作者用这组注意力头为图像 token 构建了一个简易的 logit lens(逻辑透镜)工具,可直接观察模型对图像 token 的内部解码过程,为理解 VLM 多模态表征提供了新的可解释性手段。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →