集成学习原理简介-bagging & boosting

本章会介绍集成学习的两种思想bagging和boosting,并分别介绍这两种思想的简单原理

一、什么是集成学习?

集成学习的核心思想是:不只用一个模型做预测,同时训练多个弱学习器(精度一般、容易训练的简单模型,比如决策树),再用一定规则把所有弱模型的预测结果融合,得到一个精度更高、泛化能力更强的强学习器。
单个模型容易过拟合、欠拟合、偏差或方差大,集成通过组合多个模型,平衡偏差与方差,降低预测出错的概率。
例如:用一个9次多项式函数去拟合不如用好几个简单的一次函数去拟合

二、Bagging思想

Bagging思想的核心:
1.有放回的抽样(bootstrap抽样)产生不同的训练集,从而训练不同的学习器。(例如1000行10列的数据,第一个训练集抽取500个样本,7个特征;第二个训练集抽取600个样本,6个特征)
2.通过平权投票、多数表决的方式决定预测结果
3.弱学习器可以并行训练(也就是同时进行训练)

三、Boosting思想

Boosting思想的核心:
1.每一个训练器重点关注前一个训练器不足的地方进行训练(比如第一个模型有500个对的,50个错的,第二个模型就关注那50个错的)
2.通过加权投票的方式,得出预测结果
3.串行的训练方式(先训练好一个,再训练下一个)

四、两种思想的对比

image

posted @ 2026-06-19 15:06  王新文  阅读(11)  评论(0)    收藏  举报