数据分箱:数据预处理的核心步骤
数据分箱是数据预处理的核心步骤。特征在进入模型之前最好进行分箱计算
目的是:将连续或者离散特征转化成更容易建模和解释的【离散区间】
划分多个【离散区间】
1.抑制噪音与异常值干扰
2.提示非线性关系,提升模型性能
3.数据不平衡和稀缺性
4.增强业务可解释性与决策落地
5.适配模型假设与降低计算成本
逻辑回归lr模型:特征正态分布,分箱调整区间满足假设
树模型XGB:减少分裂节点,降低计算复杂度,提升训练速度
分箱策略
根据不同特征进行分箱
连续特征(年龄 收入 消费)
有序离散特征(教育程度 vip等级 )
无序离散特征(性别 城市)
1.连续特征;划分区间和兼顾分布与业务
| 场景 | 推荐策略 | 案例/原因 |
|---|---|---|
| 数据分布均匀 | 等距分箱(Equal Width) | 身高(150-190cm,每5cm一箱):分布均匀,等距划分直观,区间边界规则。 |
| 数据分布偏态/有异常值 | 等频分箱(Equal Frequency)或分位数分箱 | 收入(右偏分布,少数高收入):等频分箱(如每20%样本一箱)可避免高收入样本集中在单一箱,保证箱内样本均衡。 |
| 有明确业务分段规则 | 自定义分箱(基于业务知识) | 房价预测中“面积<70㎡(刚需)、70-120㎡(改善)、>120㎡(豪华)”:贴合市场对户型的定义,直接指导定价。 |
| 需最大化预测能力 | 决策树分箱或卡方分箱(有监督) | 预测用户流失:用决策树以“流失率”为目标,自动找到最优分割点(如“月消费额<50元”流失率高),提升模型区分度。 |
| 数据无明显规律 | 基于聚类的分箱(如K-means) | 用户行为时长(无固定模式):K-means按时长相似性聚类,将“短时长(<10min)”“中时长(10-60min)”“长时长(>60min)”分为3箱。 |
2.有序离散特征
离散 无需
离散:取值有限的,不连续的
有序:取值之间存在顺序或者等级关系
列:
教育程度:小学 < 初中 < 高中 < 大学 < 研究生(日本房贷还款模型)
评价等级:差(1星) < 中(2星) < 好(3星) < 优秀(4星) (汽车销售服务回调)
收入分层:低收入 < 中等收入 < 高收入(日本房贷还款模型)
疾病严重程度:轻度 < 中度 < 重度(威斯康辛乳腺癌)
3.无序离散特征
离散 无序
离散:取值有限的,不连续的
有序:取值之间不存在顺序,大小,等级关系
性别:男、女 其他(无高低之分)
颜色:红、蓝、绿(无优劣顺序)
职业:教师、医生、工程师(无等级差异)
地区:北京、上海、广州(仅代表不同城市)(如果增加城市等级 则为有序离散)
核心区别
| 维度 | 有序离散特征 | 无序离散特征 |
|---|---|---|
| 取值关系 | 有明确顺序或等级(如高低、好坏) | 无顺序,仅为独立分类 |
| 关键信息 | 顺序本身具有意义 | 类别间独立,无隐含顺序 |
| 典型例子 | 教育程度、评价等级 | 性别、颜色、职业 |
连续特征
离散化(分箱)Binning
标准化Z-score
归一化Min-Max Scaling
LR线性模型偏好标准化特征
XGB树模型偏好离散特征(分箱)
有序离散特征
标签编码: 小学 初中 高中 大学 1 2 3 4
树模型 XGBoost lightGBM
目标编码:原始特征 用户等级 低中高 消费金额 100 200 300
低-100 中-200 高-300
树模型 贝叶斯模型 交叉验证或者分层验证避免数据泄露
序号编码 :标签编码相似 强调顺序性
疾病严重程度 轻度 中度 重度 编码 1 2 3
无序离散特征
独热编码:为每个类别生成一个二进制特征(0/1)仅对应类别为1 其余为0
原始数据["男", "女"] → 编码矩阵:[[1,0], [0,1]]。
线性模型 逻辑回归 向量机
虚拟编码
嵌入编码
目标编码
| 特征类型 | 核心目标 | 推荐编码方法 | 典型模型 |
|---|---|---|---|
| 连续特征 | 保留数值关系/降低尺度影响 | 标准化、归一化、分箱(转化为有序离散) | 线性模型、树模型、神经网络 |
| 有序离散特征 | 保留顺序信息 | 标签编码、目标编码、序号编码 | 树模型、目标编码适用于多种模型 |
| 无序离散特征 | 消除虚假顺序,保留类别区分 | 独热编码、虚拟编码、嵌入编码、目标编码 | 线性模型(独热/虚拟)、深度学习(嵌入) |

浙公网安备 33010602011771号