共计 2054 个字符,预计需要花费 6 分钟才能阅读完成。
背景介绍
1986 年,Rumelhart、Hinton 和 Williams 在《Nature》上发表了论文《Learning representations by back-propagating errors》,首次系统地提出了误差反向传播(Backpropagation)算法。这一工作被认为是神经网络发展史上的里程碑,解决了多层感知机(MLP)的训练难题,为现代深度学习奠定了基础。

在反向传播算法提出之前,神经网络只能训练单层结构(如感知机),无法有效地学习复杂非线性关系。Rumelhart 等人的工作通过链式法则实现了误差从输出层向输入层的逐层反向传播,使得深层网络的参数更新成为可能。
原文献解析
论文的核心贡献是提出了完整的反向传播算法框架,主要包括以下几个关键部分:
- 前向传播过程 :
- 定义了神经元的加权输入:$z_j = \sum_i w_{ji}x_i + b_j$
-
使用 sigmoid 激活函数:$y_j = \frac{1}{1+e^{-z_j}}$
-
误差计算 :
-
采用平方误差函数:$E = \frac{1}{2}\sum_k (t_k – y_k)^2$
-
反向传播过程 :
- 输出层误差项:$\delta_k = (t_k – y_k)y_k(1-y_k)$
- 隐藏层误差项:$\delta_j = y_j(1-y_j)\sum_k w_{kj}\delta_k$
- 参数更新规则:$\Delta w_{ji} = \eta \delta_j x_i$
现代实现对比
以下是使用 PyTorch 实现原始算法的示例代码:
import torch
import torch.nn as nn
class OriginalBPNet(nn.Module):
def __init__(self, input_size, hidden_size, output_size):
super().__init__()
self.fc1 = nn.Linear(input_size, hidden_size)
self.fc2 = nn.Linear(hidden_size, output_size)
self.sigmoid = nn.Sigmoid()
def forward(self, x):
x = self.sigmoid(self.fc1(x))
x = self.sigmoid(self.fc2(x))
return x
# 训练过程(手动实现反向传播)model = OriginalBPNet(10, 5, 1)
criterion = nn.MSELoss()
optimizer = torch.optim.SGD(model.parameters(), lr=0.1)
for epoch in range(100):
optimizer.zero_grad()
outputs = model(inputs)
loss = criterion(outputs, targets)
loss.backward() # 自动微分替代了原始的手动推导
optimizer.step()
与现代实现的差异:
- 现代框架使用自动微分(Autograd)而非手动推导梯度
- 优化器增加了动量、自适应学习率等改进
- 激活函数更多使用 ReLU 而非 sigmoid 以避免梯度消失
数学推导
反向传播的核心是链式法则的应用。以两层网络为例:
-
输出层权重梯度:
$$\frac{\partial E}{\partial w_{kj}} = \frac{\partial E}{\partial y_k}\frac{\partial y_k}{\partial z_k}\frac{\partial z_k}{\partial w_{kj}} = -(t_k-y_k)y_k(1-y_k)h_j$$ -
隐藏层权重梯度:
$$\frac{\partial E}{\partial w_{ji}} = \left(\sum_k \frac{\partial E}{\partial y_k}\frac{\partial y_k}{\partial z_k}\frac{\partial z_k}{\partial h_j}\right)\frac{\partial h_j}{\partial z_j}\frac{\partial z_j}{\partial w_{ji}}$$
避坑指南
常见问题及解决方案:
- 梯度消失 :
- 使用 ReLU 等现代激活函数
-
采用残差连接(ResNet)
-
数值不稳定 :
- 权重初始化(如 Xavier 初始化)
-
梯度裁剪(Gradient Clipping)
-
过拟合 :
- Dropout 正则化
- L2 权重衰减
性能考量
- 时间复杂度 :
- 前向传播:$O(\sum_{l=1}^L n_ln_{l-1})$
-
反向传播:与前向传播同阶
-
空间复杂度 :
- 需要存储所有激活值用于反向传播
- 现代框架使用计算图实现内存优化
延伸思考
反向传播算法的影响:
- 启发了卷积神经网络(CNN)和循环神经网络(RNN)的训练方法
- 奠定了端到端学习的基础范式
- 促进了自动微分技术的发展
思考题
- 如何证明反向传播算法在多层网络中的梯度计算是正确的?
- 对比原始 sigmoid 激活和现代 ReLU 激活在反向传播中的差异
- 分析批量梯度下降(BGD)和随机梯度下降(SGD)对原始算法的影响
