实测发现GPT-2注意力机制具小世界网络特性
its_vayishu · x · 2026-07-16
作者实测验证了 Transformer 注意力机制可能具有“小世界”网络特性的假设。
- 实验设计:从 GPT-2 中提取真实的注意力矩阵,通过 top-k 阈值化将其转换为图结构,并计算了所有层和头的聚类系数与路径长度。同时构建了一个未训练的相同架构模型作为对照组,以区分“学习到的特征”与“架构先天属性”。
- 惊人结果:实验不仅发现了极其显著的真实效应(p=2e-26),更离奇的是,模型在同一个 Notebook 中随后“自杀”了(推测为出现了自我毁灭的异常输出或行为),作者认为这一意外现象背后的机制非常值得深入阅读。
所属事件:实测称GPT-2注意力机制具小世界网络特性(2 条相关)→
「研究」频道最新
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11