2023年 E题 中南大学——论文精读
4.1 问题一(a)模型建立与求解
1.数据理解
比对表二中流水号与附表一中流水号得到真实时间点。 列出患者首次检查流水号与真实时间。
这一步十分关键,展现出论文中是否真正理解了题目与数据。
2.绘制分布图与饼图
论文中绘制了饼图,展现出发生血肿扩张事件的人数分布。发生了的占20%,没发生的占80%。得知这是一个样本不均衡问题
绘制直方图,横坐标为时间段,纵坐标为发生血肿扩张的人数;清晰地展现出血肿扩展发生的分布状况
4.2.1 数据处理
1.数值类型统计
绘制横坐标为数据类型,纵坐标为数据类型的个数直方图。展现出论文的数据的理解,并为后面处理方式给出原因。
2.归一化与特征编码
为避免其大小给相关性带来的误差,故对其进行归一化,二值型变量在此条件下则不同进行处理,对于文字变量(性别),为尽量降低多重共线性,我们对其进行编码处理,
3.过采样 ADASYN 处理样本不均衡问题
ADASYN 执行逻辑:
遍历全部 20 个少数类样本,计算每个样本的密度(周围多数样本越多,样本越难区分);
对难分的少数样本,在其近邻之间线性插值,人工合成新的少数类 70 条样本;
合成后少数类总数 = 原始 20 + 新增 70 = 99≈80,正负样本数量接近 1:1;
最终数据集行数 ≈ 80+80=160 行,特征依旧 74 维,无任何原始数据被删除。
4.2.2 随机森林特征提取模型
1.特征提取
随机森林基于基尼系数 Gini计算每一个特征的特征重要性(Gini 重要性),量化该特征对分类任务的区分贡献,以此筛选关键特征。
随机森林 Gini 重要性:直接以预测任务收益为标准,筛选出真正对血肿扩张分类有用的特征,不是单纯看相关性高低。
2.缺失值填充
简化版 KNN 缺失填充(K=1),等价于 1 近邻填充;通过找到与缺失值样本距离最小的一个患者进行缺失值填充;并且绘制了其他患者与数据缺失患者的误差曲线
4.2.3 基于随机森林的血肿扩张预测模型
采用用准确率、精确率、召回率、F1分数、ROC曲线、AUC分数来评价模型。
并绘制各个指标随着关键参数不同的变化趋势。
5.1.1 数据预处理
1.数据处理,得到(x,y)
计算单条影像对应的「发病至总时长 x」并且匹配对应水肿体积 y
2.绘制散点图观察数据分布
分析患者水肿体积散点分布情况,发现数据集中在散点图的左下角,且在散点图的右方和上方存在严重偏离样本中心的异常数据。删除x坐标超过最大值50%以上、y坐标超过最大值70%以上的数据点。
3.多项式模型进行回归(效果较差)
分别计算三次项、四次项、五次项拟合函数的均方误差 (MSE)和均方根误差 (RMSE);四次项的拟合效果最好。
5.2.1 动态时间规整(DTW)
1.使用DTW代替欧氏距离,便于k-means聚类
DTW(Dynamic Time Warping,动态时间规整)是基于动态规划的时序相似度度量算法,核心能力:允许采样间隔不均匀、时序存在偏移的两条曲线做最优点对点匹配,算出代表两条曲线形态相似度的 DTW 距离;距离越小,两条时序变化趋势越像。
5.2.4 基于DTW距离的K-Means聚类分析
1.确定聚类的K值
通过手肘法确定聚类的K值。手肘法计算每个簇下的簇内平方和。
2.绘制聚类后的(x,y)折线图
同一亚组内所有曲线走势高度趋同,说明 DTW 聚类分群有效,同一类患者水肿演化规律一致;
如果图里线条乱七八糟、走势完全不一样,代表聚类 K 值选错、标准化失效;
5.2.5 基于聚类结果的回归模型
采用多项式回归建立5个亚组各自的回归模型。取5个亚组标准化后的散点(x,y),采用多项式回归。
5.3 问题二c:模型的建立与求解
1.新对发展模式进行量化和编码
首先将水肿体积发展过程分为3个阶段:前期、中期和后期。再在每个阶段根据水肿体积的相对大小进行评级(分箱操作),设置0、1、2、3四个等级,分别代表水肿程度小、中、大、严重。因此每个病人都会得到三个评级。
表5-3 水肿发展模式对应的评级
| 水肿发展模式 | 前期状况评级 | 中期状况评级 | 后期状况评级 |
|---|---|---|---|
| 模式一 | 1 | 3 | 0 |
| 模式二 | 1 | 2 | 3 |
| 模式三 | 3 | 1 | 0 |
| 模式四 | 2 | 1 | 3 |
| 模式五 | 0 | 3 | 2 |
3.采用这种编码方式后重新计算一下类间距离
\(S(i,j)\) = 两类水肿模式三期评级向量之间的欧式距离
公式:
- \(i\)、\(j\):代表第\(i\)、第\(j\)水肿亚型;
- \(P\):前期评级,\(M\):中期评级,\(L\):后期评级;
- 每个亚型对应一组三维有序编码(前,中,后),两个亚型三组分数分别做差平方求和再开根号,得到类间距离。
距离越大,两种水肿进展模式差异越大;距离越小,病程走势越相似。
S(1,5)=5,S(1,2)=10,S(2,3)=14,
4.Cochran-Armitage趋势检验
接下分别考察不同治疗方法对前、中、后期状况评级的影响。这里我们使用趋势性卡方检验,又称Cochran-Armitage趋势检验(Cochran-Armitage Trend Test),它是一种用于分析两个分类变量之间是否存在有序趋势的统计检验方法。
5.绘制热力图
还应该注意到,各种治疗方法之间并不是完全独立的,一些治疗方法往往会同时用到,作为组合治疗的手段。图5-22治疗方法间的热力图,从图中可以看出,降颅压治疗和止血治疗之间有着较强的相关性,止吐护胃和镇静、镇痛治疗之间也有较强的相关性,根据我们对数据的统计,这些治疗组合出现频率很高。
5.4.1 血肿体积、水肿体积与治疗方法之间的关系
1.Mann-Whitney U检验
Mann-Whitney U不依赖原始数值大小,把两组所有数据混合排序,给每个数据赋予秩(排名);计算两组各自秩和,构造 U 统计量,判断两组数据整体位置是否有偏移:
因此Mann-Whitney U检验分析血肿、水肿体积与7种治疗方式的相关性。
5.4.2 血肿体积与水肿体积之间的关系
计算二者之间的相关性系数值,提取每位病人血肿体积和水肿体积的多次检查结果的平均值,绘制这两个变量的联合分布图

浙公网安备 33010602011771号