博客长文把激活函数拆成骨架:斜率曲率饱和度如何决定梯度与可训练性
CatAstro_Piyush · x · 2026-10-09
受「是激活函数在抢走你的工作」这条推文启发,作者写了一篇数学解剖激活函数的长文。要点:
- 神经元的矩阵乘法含数百万可学习参数,而激活函数通常只有一行代码、零参数;但去掉它上百层网络会坍缩成一个线性映射,换掉它的形状会让同一架构变得好训、慢训、稀疏、平滑或不稳定。
- 作者提出一个「骨架模型」来拆解任意激活函数:肩膀=输入域、颅骨=输出范围、脊柱=前向变换 ϕ(z)、手肘=斜率(导数,控制梯度流动)、膝盖=曲率(斜率如何变化)等部位,逐一对应其数学属性。
- 再讲「大脑」部分:这些部件如何在前向信号、反向梯度、表征几何和可训练性四个层面起作用——例如 ReLU 砍掉负半轴、Sigmoid 把整条实数轴压缩成概率区间、GELU/SiLU 让少量负信号泄漏后正侧近似线性、正弦函数则永不饱和。
- 核心论点:激活函数在图上看差异像只是外观,实际上其解剖的每一部分都参与训练。
「研究」频道最新
- PersistBench 登 NeurIPS Spotlight:4D 基础模型其实不太有视觉记忆 — weichiuma · 2026-10-09
- StarkWare 创始人:AI 解出 Erdős 单位距离问题后,数学证明已不可预测 — jamestagg · 2026-10-09
- Claude Science 生成首张完整紫外全天图,预测偏差仅约 10% — The Decoder · 2026-10-09
- FreeMatching:突破时空先验的图像编辑稠密对应匹配框架 — hkuhk · 2026-10-09
- WorldGuide:闭环任务执行的定向视频世界模型,胜 MiniMax-H3 — MBZUAI · 2026-10-09
- REMORY:用软记忆 token 补全上下文压缩,仅 5.2% 输入逼近全上下文 — Hanchen Xia · 2026-10-09