数据分箱:数据预处理的核心步骤

数据分箱是数据预处理的核心步骤。特征在进入模型之前最好进行分箱计算
目的是:将连续或者离散特征转化成更容易建模和解释的【离散区间】
划分多个【离散区间】
1.抑制噪音与异常值干扰
2.提示非线性关系,提升模型性能
3.数据不平衡和稀缺性
4.增强业务可解释性与决策落地
5.适配模型假设与降低计算成本
逻辑回归lr模型:特征正态分布,分箱调整区间满足假设
树模型XGB:减少分裂节点,降低计算复杂度,提升训练速度

分箱策略
根据不同特征进行分箱
连续特征(年龄 收入 消费)
有序离散特征(教育程度 vip等级 )
无序离散特征(性别 城市)

1.连续特征;划分区间和兼顾分布与业务

场景​​ ​​推荐策略​​ ​​案例/原因​​
​​数据分布均匀​​ 等距分箱(Equal Width) 身高(150-190cm,每5cm一箱):分布均匀,等距划分直观,区间边界规则。
​​数据分布偏态/有异常值​​ 等频分箱(Equal Frequency)或分位数分箱 收入(右偏分布,少数高收入):等频分箱(如每20%样本一箱)可避免高收入样本集中在单一箱,保证箱内样本均衡。
​​有明确业务分段规则​​ 自定义分箱(基于业务知识) 房价预测中“面积<70㎡(刚需)、70-120㎡(改善)、>120㎡(豪华)”:贴合市场对户型的定义,直接指导定价。
​​需最大化预测能力​​ 决策树分箱或卡方分箱(有监督) 预测用户流失:用决策树以“流失率”为目标,自动找到最优分割点(如“月消费额<50元”流失率高),提升模型区分度。
​​数据无明显规律​​ 基于聚类的分箱(如K-means) 用户行为时长(无固定模式):K-means按时长相似性聚类,将“短时长(<10min)”“中时长(10-60min)”“长时长(>60min)”分为3箱。

2.有序离散特征
离散 无需
离散:取值有限的,不连续的
有序:取值之间存在顺序或者等级关系
列:
教育程度:小学 < 初中 < 高中 < 大学 < 研究生(日本房贷还款模型)
评价等级:差(1星) < 中(2星) < 好(3星) < 优秀(4星) (汽车销售服务回调)
收入分层:低收入 < 中等收入 < 高收入(日本房贷还款模型)
疾病严重程度:轻度 < 中度 < 重度(威斯康辛乳腺癌)

3.无序离散特征
离散 无序
离散:取值有限的,不连续的
有序:取值之间不存在顺序,大小,等级关系

性别:男、女 其他(无高低之分)
颜色:红、蓝、绿(无优劣顺序)
职业:教师、医生、工程师(无等级差异)
地区:北京、上海、广州(仅代表不同城市)(如果增加城市等级 则为有序离散)

核心区别

​​维度​​ ​​有序离散特征​​ ​​无序离散特征​​
取值关系 有明确顺序或等级(如高低、好坏) 无顺序,仅为独立分类
关键信息 顺序本身具有意义 类别间独立,无隐含顺序
典型例子 教育程度、评价等级 性别、颜色、职业

连续特征
离散化(分箱)Binning
标准化Z-score
归一化Min-Max Scaling

LR线性模型偏好标准化特征
XGB树模型偏好离散特征(分箱)

有序离散特征
标签编码: 小学 初中 高中 大学 1 2 3 4
树模型 XGBoost lightGBM

目标编码:原始特征 用户等级 低中高 消费金额 100 200 300
低-100 中-200 高-300
树模型 贝叶斯模型 交叉验证或者分层验证避免数据泄露

序号编码 :标签编码相似 强调顺序性
疾病严重程度 轻度 中度 重度 编码 1 2 3

无序离散特征
独热编码:为每个类别生成一个二进制特征(0/1)仅对应类别为1 其余为0
原始数据["男", "女"] → 编码矩阵:[[1,0], [0,1]]。
线性模型 逻辑回归 向量机

虚拟编码
嵌入编码
目标编码

特征类型​​ ​​核心目标​​ ​​推荐编码方法​​ ​​典型模型​​
连续特征 保留数值关系/降低尺度影响 标准化、归一化、分箱(转化为有序离散) 线性模型、树模型、神经网络
有序离散特征 保留顺序信息 标签编码、目标编码、序号编码 树模型、目标编码适用于多种模型
无序离散特征 消除虚假顺序,保留类别区分 独热编码、虚拟编码、嵌入编码、目标编码 线性模型(独热/虚拟)、深度学习(嵌入)
posted @ 2025-10-21 00:24  YanRoBin6  阅读(124)  评论(0)    收藏  举报