手推一个两层小网络,讲透反向传播与梯度更新全过程
techNmak · x · 2026-10-06
Jon Barron 用一个极小网络(1 输入、2 个 ReLU 隐藏单元、线性输出)手把手演示反向传播:前向传播得到预测与损失 0.5,再用链式法则沿计算图反向传递梯度——隐藏层权重不直接影响损失,必须经「权重→隐藏单元→预测→损失」路径求导;多条路径的梯度贡献相加。示例中两个 pre-activation 均为正,ReLU 局部斜率为 1,梯度无衰减通过;若为负则梯度归零、该路径无贡献。反向算完得四个权重的梯度,再用普通 SGD 同步更新(所有梯度必须在更新前基于同一参数值计算)。更新后再前向,预测变为 -0.49,损失降至 0.12005(作者提醒任意学习率并不保证每步降损)。核心结论:反向传播只负责算梯度,SGD 才是真正改权重的环节,实践中大网络的计算逻辑与此完全相同。
「研究」频道最新
- UT Austin 数学系主任:OpenAI 拟一次放出约 400 个 AI 证明 — 141_1337 · 2026-10-06
- RT-SAFE 基准:8 个前沿 VLM 任务成功率达 94%,安全通过率仅 0.7% — Lianhuiq · 2026-10-06
- 动态权重嫁接:定位微调事实在 Transformer 中的两条检索通路 — ChenhaoTan · 2026-10-06
- 数学家 Strogatz 指出 Wolfram 囚徒困境实验缺了演化选择这一环 — stevenstrogatz · 2026-10-06
- 预测与实测扰动相关性仅 0.08,学者质疑「虚拟细胞」巨额投入方向 — anshulkundaje · 2026-10-06
- LLM 说「不确定」时到底指什么:校准与语义之辩 — sineadwilliamso · 2026-10-06