手工推导 Batch Norm,讲清它到底归一化什么
ProfTomYeh · x · 2026-07-21
手工推导 Batch Norm:一页算清它到底在做什么
这篇帖子用一个 4 条样本的小例子,手工演示了 batch normalization 的完整流程。
讲清了几件事
- Batch norm 是放在 线性层之后,归一化的是 特征,不是输入、权重或偏置。
- 先按特征维度计算整批样本的 均值、方差和标准差。
- 再依次做 减均值、除标准差,把每个特征拉到零均值、单位方差。
- 最后再通过可训练的 scale 和 shift 把表示空间交还给网络。
关键结论
作者特别强调:统计量不是可训练参数,可训练的是最后的仿射变换;并且 batch norm 和 layer norm 的区别,在于前者跨 batch 统计,后者跨特征统计。
「研究」频道最新
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- OpenAI 与 Apollo 推出 Contrastive SDF 量化奖赏投机 — OpenAI · 2026-07-22
- NVIDIA:先调好 Harness,再去调模型 — NVIDIAAI · 2026-07-22
- AI 发展的瓶颈:从互联网数据红利到高质量反馈闭环 — dyamins · 2026-07-22
- NVIDIA 公布 22 篇 SIGGRAPH 论文与机器人仿真工具 — facontidavide · 2026-07-22
- 不用图数据库构建知识图谱,成本比GraphRAG低1000倍 — TheRedfather · 2026-07-22