原始激活与SAE特征强度的PCA几何结构对比
Sauers_ · x · 2026-07-08
研究者对比了神经网络原始激活值的PCA(呈现规整圆形)与稀疏自编码器(SAE)特征强度的PCA(形态紊乱)两种表示方式,发现两者在几何结构上存在显著差异。该实验揭示SAE特征空间与原始激活空间之间的潜在不一致,对机械可解释性(Mechanistic Interpretability)研究有参考价值。可视化图像由OpenAI o4.8模型辅助生成。
「研究」频道最新
- VidMap 用 RoMa 粗匹配全帧、精细匹配仅限关键帧 — ducha_aiki · 2026-09-11
- Bug Hunt Bench 作者补充:榜单噪声幅度约 2-3 分 — PawelHuryn · 2026-09-11
- 台球计算模型登 PNAS:二维系统已存在不可判定性,可跑通用计算机 — eigensteve · 2026-09-11
- 新研究:从仿射变换与重力线索求解绝对位姿 — ducha_aiki · 2026-09-11
- LoMa 论文发布 REALLY HardPairs 数据集,入选 ECCV 2026 — ducha_aiki · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11