2023年 E题 西安交通大学 论文精读

4.2.2数据预处理

1.箱线图

通过绘制表 3 是高维影像特征(异常值危害远大于表 1、表 2,且它是模型核心输入,必须提前清洗)数据的箱线图剔除处于上下边缘的异常值

2.特征编码和归一化

将数值数据利用下面公式进行归一化,文字数据进行编码

\[x' = \frac{x - a}{b - a} \]

3.绘制剔除异常值前后的箱线图与分布图

本文对72个连续数值变量使用了箱型图剔除低质量数据,以某一列为例,绘制图形对比

4.特征合并

将左右侧大脑的数据相加,减少自变量的共线性和特征的数量

5.寻找特征分布

绘制患者影像形状及灰度分布图,观察其正态性

6.绘制矩阵散点图

绘制患者影像形状矩阵散点图,发现变量之间和相关性,并选择合适的变量组合进行模型训练。

总结

这一部分属于数据处理与可视化的内容,目的是展示数据的形状,虽然论文中一些展示并没有对后续分析起到多大作用;

4.2.3 特征提取

1.leaf-wise生长策略

leaf-wise每次只从全部现有叶子里挑分裂增益最大的那 1 个单独分裂,只在最能降低误差的地方深挖;只分裂最优叶子,精度更高,但必须限制深度防过拟合;

2.相关性分析

采用斯皮尔曼等级相关系数,因为其用于衡量两个变量之间的单调关系,即它们是否具有相同的变化趋势(如线性函数、指数函数、对数函数),不仅局限于线性关系。

3.特征提取结果

(1)患者的临床信息

使用随机森林对该数据建模,然后提取feature_importances_这一指标,使用基尼系数重要性作为判定标准;

(2)患者影像体积与位置信息

以 ** 血肿是否发生扩张(0/1 二分类标签)** 作为因变量,将表 2 经过左右脑区合并后得到的 10 个连续位置特征作为自变量,训练 LightGBM 二分类模型,通过特征分裂的总增益(Gain)计算特征重要度,排序后筛选高贡献特征,实现特征降维提取。

(3)思考:为什么一个用随机森林,一个用LightGBM?

数据类型适配:随机森林适配临床离散 + 连续混合特征;LightGBM 适配脑区连续型特征;

(4)相关性分析与特征处理(这一步有所不妥)

将强相关性的特征进行相加,变成新的特征;
根据相关性分析结果进行特征融合。将患者影像形状特征和患者影像灰度分布特征中具有显著相关的特征利用公式(4.4)融合为一类特征。

\[Feature_{M} = \sum_{i=1}^{k} Feature_{i} \quad i=1,2,\dots,k \tag{4.4} \]

(5)预测模型的混淆矩阵,准确率、精确率、召回率和F1

对比三种机器学习模型的混淆矩阵,准确率、精确率、召回率和F1进行预测

5.1.2数据预处理

1.数据处理

将水肿体积以𝑚𝑙为单位表达,即原始数据除以1000。若相同时间内存在多个水肿体积,则以水肿体积均值代替。

2.绘制散点图

绘制散点图来观察患者水肿体积随发病时间的变化趋势

3.按照发病时间划分出 5 个不同时间段

不同患者的水肿进展曲线差异大,水肿变化受病因、病程、治疗方案等因素影响,从医学角度论证分段拟合的合理性,避免读者认为是人为随意分段;
解释为什么不能采用全局单一函数拟合水肿时序数据;

5.1.3 拟合模型

采用高斯拟合和多项式拟合对时间段进行分段拟合

5.2.2 K-means 聚类分组

题目中要求构建不同人群(分亚组:3-5个)的水肿体积随时间进展曲线;因此采用K-means 聚类模型分出不同组别,然后再进行模型拟合计算残差

5.3.2 数据处理

1.处理不均衡样本

由于每一位患者进行随访的次数不相同,导致样本不均衡。为了处理不均衡数据,现引入水肿体积进展率(𝐸𝐷𝑝𝑟)

2.水肿体积进展模式分类

根据𝐸𝐷𝑝𝑟数据将水肿体积进展模式分为5种模式,用于后续的关联性分析。

5.3.4 关联度分析

1.随机森林

以所有治疗方案作为输入特征,水肿进展模式作为预测标签训练随机森林多分类模型,通过特征重要性表征该治疗方式与水肿进展模式的关联强弱:

2.灰色关联度

将每种治疗方式作为参考序列,不同水肿进展模式下的样本分布作为比较序列,计算灰色关联系数与灰色关联度

5.4.3 相关性探究

利用线性回归模型探究算血肿体积绝对变化与治疗方案的关系,和水肿体积绝对变化与治疗方案的关系;
血肿变化绝对体积(𝐻𝑀𝑣𝑉)与水肿变化绝对体积(𝐸𝐷𝑣𝑉)进行二次多项式回归;

6.1.3 特征提取

使用卡方检验、lasso回归、XGBoost、递归特征消除、前向选择和后向选择、𝐿𝑖𝑔ℎ𝑡𝐺𝐵𝑀共六种模型进行特征提取。
卡方检验可以检验离散自变量与分类因变量是否独立,如果独立说明就排除这个特征
lasso回归添加的L1 惩罚可以把不重要特征的回归系数直接压缩到 0。

6.2.2 问题求解

针对本次研究存在的样本类别不均衡与特征维度分布不均衡双重问题,本文采取多层策略优化

1.插值

采用多重插补结合 K 近邻插补完成时序缺失数据填充,统一样本特征维度,最大限度保留特征完备的少量样本,缓解特征完备度不均衡带来的建模偏差;

2.特征筛选

其次采用六种特征筛选方法结合投票策略构建两组稳健特征子集,筛选具备稳定区分能力的特征,降低冗余特征导致的小样本过拟合;

3.预测模型针对

最后选用 XGBoost、LightGBM 等可设置类别权重的集成树模型,通过赋予少数类更高训练权重的方式优化类别不平衡问题,并基于两组特征集对比建模,筛选最优预测模型,有效改善不均衡样本下模型偏向多数类的缺陷。

posted @ 2026-07-03 17:41  王新文  阅读(9)  评论(0)    收藏  举报