机器学习入门:从流程图解析AdaBoost、随机森林与GBDT的核心原理与实现

1次阅读
没有评论

共计 2950 个字符,预计需要花费 8 分钟才能阅读完成。

image.webp

背景与痛点

集成学习通过组合多个基学习器来提升模型性能,是机器学习中的重要方法。但对于初学者来说,AdaBoost、随机森林和 GBDT 这三种主流集成算法常常让人感到困惑:

机器学习入门:从流程图解析 AdaBoost、随机森林与 GBDT 的核心原理与实现

  • 算法决策过程不透明,难以理解内部工作机制
  • 参数调优复杂,不知道如何选择合适的超参数
  • 不清楚不同算法间的区别和适用场景
  • 实现时容易遇到过拟合或欠拟合问题

本文将用流程图和对比分析的方式,帮助新手理解这三种算法的核心原理和实现细节。

技术对比

首先,我们通过下表对比三种算法的关键特性:

特性 AdaBoost 随机森林 GBDT
基学习器 弱学习器(如决策树桩) 完全生长的决策树 决策树(通常浅层)
样本权重 迭代更新 自助采样(bootstrap) 基于梯度调整
并行性 串行 并行 串行
主要参数 学习率、迭代次数 树的数量、最大深度 学习率、迭代次数
主要目标 最小化指数损失 减少方差 最小化损失函数梯度

核心实现

1. AdaBoost 算法流程

AdaBoost 的核心思想是通过迭代调整样本权重,让后续的基学习器更关注之前分类错误的样本。其流程如下:

  1. 初始化样本权重为均等值
  2. 训练第一个基分类器(通常是决策树桩)
  3. 计算分类器误差率并更新样本权重
  4. 根据误差率计算分类器权重
  5. 重复步骤 2 - 4 直到达到预设的迭代次数
  6. 将所有基分类器的预测结果加权求和得到最终预测

2. 随机森林算法流程

随机森林通过构建多棵决策树并投票决定最终结果,其核心流程为:

  1. 从原始数据集中进行自助采样 (bootstrap) 创建多个子数据集
  2. 对每个子数据集训练一棵决策树
  3. 在每棵树的节点分裂时,随机选择部分特征进行考察
  4. 让每棵树完全生长(不剪枝)
  5. 对于分类问题使用投票法,回归问题使用平均法聚合结果

3. GBDT 算法流程

GBDT(梯度提升决策树)通过梯度下降的方式逐步改进模型:

  1. 初始化模型,通常使用常数函数(如目标变量的均值)
  2. 计算当前模型的负梯度(伪残差)
  3. 用决策树拟合这些伪残差
  4. 通过线搜索确定步长(学习率)
  5. 更新模型:当前模型 = 前一步模型 + 学习率 × 新树
  6. 重复步骤 2 - 5 直到满足停止条件

代码示例

AdaBoost 实现

from sklearn.ensemble import AdaBoostClassifier
from sklearn.tree import DecisionTreeClassifier
from sklearn.datasets import make_classification
from sklearn.model_selection import train_test_split

# 生成模拟数据
X, y = make_classification(n_samples=1000, n_features=20, random_state=42)
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)

# 创建 AdaBoost 模型
ada = AdaBoostClassifier(base_estimator=DecisionTreeClassifier(max_depth=1),
    n_estimators=50,
    learning_rate=1.0,
    random_state=42
)

# 训练模型
ada.fit(X_train, y_train)

# 评估模型
print(f"Train accuracy: {ada.score(X_train, y_train):.3f}")
print(f"Test accuracy: {ada.score(X_test, y_test):.3f}")

随机森林实现

from sklearn.ensemble import RandomForestClassifier

# 创建随机森林模型
rf = RandomForestClassifier(
    n_estimators=100,
    max_depth=10,
    max_features='sqrt',
    random_state=42
)

# 训练模型
rf.fit(X_train, y_train)

# 评估模型
print(f"Train accuracy: {rf.score(X_train, y_train):.3f}")
print(f"Test accuracy: {rf.score(X_test, y_test):.3f}")

# 查看特征重要性
import matplotlib.pyplot as plt
importances = rf.feature_importances_
plt.bar(range(X.shape[1]), importances)
plt.xlabel('Feature index')
plt.ylabel('Feature importance')
plt.show()

GBDT 实现

from sklearn.ensemble import GradientBoostingClassifier

# 创建 GBDT 模型
gbdt = GradientBoostingClassifier(
    n_estimators=100,
    learning_rate=0.1,
    max_depth=3,
    random_state=42
)

# 训练模型
gbdt.fit(X_train, y_train)

# 评估模型
print(f"Train accuracy: {gbdt.score(X_train, y_train):.3f}")
print(f"Test accuracy: {gbdt.score(X_test, y_test):.3f}")

# 查看训练过程中损失函数的变化
plt.plot(gbdt.train_score_)
plt.xlabel('Number of trees')
plt.ylabel('Training loss')
plt.show()

避坑指南

调参技巧

  • AdaBoost
  • 适当限制基学习器复杂度(如 max_depth=1)
  • 学习率通常在 0.5- 1 之间
  • 迭代次数 (n_estimators) 可以通过早停法确定

  • 随机森林

  • 树的数量 (n_estimators) 越大越好,但要考虑计算成本
  • 每棵树的最大深度 (max_depth) 通常不需要太大
  • 特征子集大小 (max_features) 一般设为 sqrt(n_features)

  • GBDT

  • 学习率 (learning_rate) 越小,需要的迭代次数越多
  • 采用早停法 (n_iter_no_change) 防止过拟合
  • 子采样 (subsample) 可以增加随机性,减少过拟合

常见误区

  1. 忽视特征缩放:虽然基于树的算法对特征缩放不敏感,但当特征尺度差异极大时仍可能影响性能。

  2. 过早停止训练:GBDT 需要足够多的迭代才能收敛,过早停止可能导致欠拟合。

  3. 忽略过拟合迹象:训练集表现很好但测试集表现差,可能是过拟合的信号。

  4. 忽视类别不平衡:对于不平衡数据,需要使用 class_weight 参数或调整采样策略。

延伸思考

  1. 如何结合 AdaBoost、随机森林和 GBDT 的优势设计混合模型?
  2. 在不同应用场景下(如金融风控、医疗诊断),如何选择最合适的集成算法?
  3. 如何将这些算法扩展到大规模数据集上?
  4. 深度学习时代,这些传统集成算法还有哪些不可替代的优势?

希望这篇教程能帮助你理解这三种重要集成算法的工作原理和实现方式。记住,最好的学习方式是实践,尝试在自己的数据集上应用这些算法,观察它们的不同表现。

正文完
 0
评论(没有评论)