新研究定位 VLM 中负责 OCR 的注意力头,竟能读出图像全部语义
gsarti_ · x · 2026-09-29
研究者 Sheridan Feucht 发布新预印本,探讨视觉语言模型中图像与词语的对齐机制。团队找到一组专门负责 OCR 的注意力头,但意外发现这些头能「口述」的远不止画面中的文字——还能读出图像的更多语义信息。基于这一发现,作者用这组注意力头为图像 token 构建了一个简易的 logit lens(逻辑透镜)工具,可直接观察模型对图像 token 的内部解码过程,为理解 VLM 多模态表征提供了新的可解释性手段。
「研究」频道最新
- 意外发现:平均 OCR 注意力头可得高质量可解释性透镜 — benno_krojer · 2026-09-29
- 接触密集型机器人 RL 论文获 IROS workshop 最佳学生论文奖 — GeorgiaChal · 2026-09-29
- saezlab 开源 mc-ASTRA:跨患者与时间点研究组织重塑的 Python 框架 — anshulkundaje · 2026-09-29
- SK 模型采样难题突破:多项式时间算法覆盖 β<1 全区间 — canondetortugas · 2026-09-29
- 实测 Jev 跑推理密集型回归任务:快但准头一般 — dbreunig · 2026-09-29
- Ramez Naam 长文驳智能爆炸:RSI 正在多线遭遇收益递减 — natolambert · 2026-09-29