共计 1919 个字符,预计需要花费 5 分钟才能阅读完成。
背景介绍
神经网络是机器学习中模仿生物神经系统工作方式的重要模型。BP(Back Propagation)神经网络通过误差反向传播算法进行训练,能够自动调整网络参数,使其具备强大的非线性拟合能力。BP 算法的核心价值在于:

- 实现了多层神经网络的参数高效更新
- 为深度学习的发展奠定了基础
- 在分类、回归等任务中表现优异
数学原理
前向传播
前向传播是数据从输入层流向输出层的过程。对于三层网络(输入层、隐藏层、输出层),计算步骤如下:
- 输入层到隐藏层:
$$h = \sigma(W_1 \cdot x + b_1)$$ - 隐藏层到输出层:
$$y = \sigma(W_2 \cdot h + b_2)$$
其中 $\sigma$ 表示激活函数(如 sigmoid),$W$ 为权重矩阵,$b$ 为偏置项。
损失函数与梯度下降
常用均方误差作为损失函数:
$$L = \frac{1}{2}(y – \hat{y})^2$$
梯度下降通过计算损失函数对参数的偏导来更新参数:
$$W = W – \eta \cdot \frac{\partial L}{\partial W}$$
反向传播
反向传播利用链式法则计算梯度:
- 输出层梯度:
$$\frac{\partial L}{\partial W_2} = (y – \hat{y}) \cdot \sigma'(z_2) \cdot h^T$$ - 隐藏层梯度:
$$\frac{\partial L}{\partial W_1} = [(y – \hat{y}) \cdot \sigma'(z_2) \cdot W_2^T] \cdot \sigma'(z_1) \cdot x^T$$
Python 实现
import numpy as np
class NeuralNetwork:
def __init__(self, input_size, hidden_size, output_size):
# 参数初始化
self.W1 = np.random.randn(input_size, hidden_size) * 0.01
self.b1 = np.zeros((1, hidden_size))
self.W2 = np.random.randn(hidden_size, output_size) * 0.01
self.b2 = np.zeros((1, output_size))
def sigmoid(self, x):
return 1 / (1 + np.exp(-x))
def sigmoid_derivative(self, x):
return x * (1 - x)
def forward(self, X):
self.z1 = np.dot(X, self.W1) + self.b1
self.h = self.sigmoid(self.z1)
self.z2 = np.dot(self.h, self.W2) + self.b2
return self.sigmoid(self.z2)
def backward(self, X, y, output, learning_rate):
# 计算输出层误差
error = output - y
d_output = error * self.sigmoid_derivative(output)
# 计算隐藏层误差
error_h = np.dot(d_output, self.W2.T)
d_hidden = error_h * self.sigmoid_derivative(self.h)
# 更新参数
self.W2 -= learning_rate * np.dot(self.h.T, d_output)
self.b2 -= learning_rate * np.sum(d_output, axis=0, keepdims=True)
self.W1 -= learning_rate * np.dot(X.T, d_hidden)
self.b1 -= learning_rate * np.sum(d_hidden, axis=0, keepdims=True)
def train(self, X, y, epochs, learning_rate):
for i in range(epochs):
output = self.forward(X)
self.backward(X, y, output, learning_rate)
实战建议
学习率设置
- 初始值通常设为 0.01
- 可采用学习率衰减策略
- 结合验证集效果调整
过拟合应对
- 使用 L2 正则化
- 实施 dropout
- 增加训练数据量
激活函数选择
- ReLU 适合隐藏层
- 输出层根据任务选择(softmax 用于多分类)
性能优化
训练方式
- 批量训练稳定但内存消耗大
- 在线训练适合流式数据
- 小批量训练是折中方案
梯度消失
- 使用 ReLU 激活函数
- 采用批标准化
- 尝试残差连接
思考题
如何修改网络结构来处理图像分类任务?
可以考虑:
1. 增加网络深度
2. 使用卷积层替代全连接层
3. 添加池化层减少参数
4. 采用交叉熵损失函数
正文完
