👋 欢迎浏览我的技术博客,记录学习笔记 本人28届软工一枚

7.12 机器学习(七)集成学习

一.核心思想

多个弱学习器(简单模型:单层决策树、逻辑回归)组合成强学习器,整体效果优于单个模型。

二.主流框架

1.Begging

a.原理:从原数据集有放回抽n份样本,每份独立训练一个弱分类器,预测时分类问题投票,回归问题取均值(并行独立训练)

b.代表算法:随机森林

流程:
(1)对原始数据集有放回随机采样,生成单棵树专属训练集;(会重复抽到同一样本,也会有部分样本没被抽到)
(2)每次节点分裂时,随机选取部分特征;
(3)用最优分割标准(分类:基尼系数 / 熵;回归:MSE 均方误差)分裂,完整生长树,不剪枝;
总结:每一个树均使用决策树等进行构建
特点:样本(bootstrap)和特征(随机选取部分特征计算基尼/熵)均随机抽取,降低方差,缓解过拟合,各模型无依赖,可多线程加速,对噪声、异常值鲁棒

2.boosting

a.原理:初始时权重均等,后一个模型在训练时会将前一个模型出错的样本加权重在预测时弱学习器

b.代表算法:AdaBoost,GBDT梯度提升树,XGBoost、LightGBM

特点:降低偏差,擅长拟合复杂数据,串行训练,无法并行,对异常值、噪声敏感,易过拟合

posted @ 2026-07-12 08:16  气球飞起  阅读(3)  评论(0)    收藏  举报