从零实现对比 BatchNorm/LayerNorm/GroupNorm
jcflynnnn · reddit · 2026-08-01
开发者为了深入理解模型中常用的归一化层,从零实现了 BatchNorm、LayerNorm 和 GroupNorm,并在一个简单的 MNIST 三层 MLP 上进行了对比测试。
主要发现:
- 死神经元修复:无归一化时,大量神经元在批次内完全不激活(呈现白色);加入归一化后,神经元激活变得与输入相关。
- 效果相当:在该任务中,三者表现接近(测试准确率均从 84.1% 提升至约 95%-96%)。
- 几何视角:LayerNorm 将样本投影到特征和为零的子空间并固定范数;GroupNorm 则是其在分组上的泛化。
作者还分享了完整的代码和可视化图表,并探讨在实际的小批次视觉任务之外,GroupNorm 的分组假设在哪些场景下真正具有优势。
「研究」频道最新
- 模型没问题是约束失效:解析近期 AI 越权事件本质 — drhyrum · 2026-08-01
- MIT 四日 AI 课程总结:科学家正转型为 AI 智能体管理者 — ProfBuehlerMIT · 2026-08-01
- AI Agent 新突破:攻克核磁共振结构解析难题 — AllThingsApx · 2026-08-01
- 神经元突触聚类如何影响学习?计算模型揭示因果机制 — KordingLab · 2026-08-01
- AI写作检测新工具:infini-gram引擎可追溯AI生成文本的词汇来源 — allen_ai · 2026-08-01
- Meh-Compression:基于切换线性矩阵的模型压缩法 — oatmealcraving · 2026-08-01