意外发现:平均 OCR 注意力头可得高质量可解释性透镜
benno_krojer · x · 2026-09-29
- bennokrojer 分享一段可解释性研究轶事:团队最初并非想找通用透镜,sheridanfeucht 只是想定位 OCR 相关的注意力头。
- 意外发现:把这些注意力头(甚至跨层)平均成一个矩阵后,竟构成了一个效果很好的解释透镜(lens)。
- 说明可解释性中通用工具有时来自非常局部的探索,值得做 attn head 分析的人尝试。
「研究」频道最新
- COLM 口头报告论文:用效度检验审问 56 个 AI 基准,结果出人意料 — ang3linawang · 2026-09-29
- EMNLP 论文:推理模型更强但置信度未必更可靠 — zhaoran_wang · 2026-09-29
- Anthropic 实测:基础设施配置可让编程评测相差 6 个百分点 — giansegato · 2026-09-29
- GoFish 演示层级式动画图表:分组柱状图逐月生长 — arvindsatya1 · 2026-09-29
- 作者回应评测质疑:跑过多次,但别过度迷信行业基准分 — giansegato · 2026-09-29
- 重磅预告:无需反向传播,零阶优化直接预训练 Transformer — teortaxesTex · 2026-09-29