手推一个两层小网络,讲透反向传播与梯度更新全过程

techNmak · x · 2026-10-06

Jon Barron 用一个极小网络(1 输入、2 个 ReLU 隐藏单元、线性输出)手把手演示反向传播:前向传播得到预测与损失 0.5,再用链式法则沿计算图反向传递梯度——隐藏层权重不直接影响损失,必须经「权重→隐藏单元→预测→损失」路径求导;多条路径的梯度贡献相加。示例中两个 pre-activation 均为正,ReLU 局部斜率为 1,梯度无衰减通过;若为负则梯度归零、该路径无贡献。反向算完得四个权重的梯度,再用普通 SGD 同步更新(所有梯度必须在更新前基于同一参数值计算)。更新后再前向,预测变为 -0.49,损失降至 0.12005(作者提醒任意学习率并不保证每步降损)。核心结论:反向传播只负责算梯度,SGD 才是真正改权重的环节,实践中大网络的计算逻辑与此完全相同。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →