疾病影响因素的Firth回归:小样本偏差修正
疾病影响因素的Firth惩罚Logistic回归分析
1 案例背景
在流行病学研究中,当因变量类别比例严重失衡时,传统最大似然估计的Logit回归模型容易产生分离现象,导致回归系数估计趋于无穷大或标准误膨胀。Firth惩罚Logistic回归通过在似然函数中引入惩罚项,有效缓解了小样本或稀有事件条件下的估计偏倚问题,被广泛应用于罕见疾病的危险因素识别。本研究以某地区200名居民的健康体检数据为基础,因变量为是否患病(0=未患病,1=患病),自变量包括年龄(标准化)、BMI(标准化)、吸烟史(标准化)和家族史(标准化),借助SPSSAU在线数据分析平台完成Firth惩罚Logistic回归分析,旨在识别疾病发生的关键危险因素。
2 分析结果
在SPSSAU【进阶方法】模块选择【Firth惩罚logit回归】,将变量拖拽至右侧对应分析框,操作如下图:

2.1 因变量分布与模型整体检验
表1呈现了因变量的频数分布。在200个有效观测中,未患病样本152例(76.000%),患病样本48例(24.000%),两类比例约为3.16:1,存在一定程度的不均衡。正因如此,采用Firth惩罚Logistic回归相较于普通二元Logit回归更为恰当,能够有效规避因类别失衡导致的估计偏倚。

表1 Firth惩罚Logit回归分析基本汇总
表2报告了似然比检验结果。仅截距模型的-2倍对数似然值为216.833,引入四个自变量后最终模型降至140.944,似然比卡方χ²=75.889,自由度df=4,p<0.001,表明自变量的引入显著提升了模型对因变量的解释能力。最终模型的AIC值为150.944,BIC值为167.436,信息准则值处于合理范围,模型整体具有良好的统计有效性。

表2 Firth惩罚Logit回归模型似然比检验结果
2.2 回归系数估计与显著性检验
表3报告了各变量的Firth惩罚Logistic回归系数及显著性检验结果。年龄(标准化)的回归系数β=1.385(SE=0.264,z=5.237,Wald χ²=27.427,p<0.001),OR=3.993,95%CI为[2.378, 6.705],表明年龄每增加一个标准差单位,患病的胜算比约扩大至原来的3.99倍,是疾病发生最为显著的危险因素。BMI(标准化)的回归系数β=0.894(SE=0.222,z=4.022,Wald χ²=16.180,p<0.001),OR=2.446,95%CI为[1.582, 3.782],表明BMI每增加一个标准差单位,患病胜算比约增至原来的2.45倍,同样具有显著正向影响。
家族史(标准化)的回归系数β=0.446(SE=0.201,z=2.224,Wald χ²=4.946,p=0.026),OR=1.562,95%CI为[1.054, 2.314],在0.05水平上显著,表明有家族病史的个体患病风险显著更高。吸烟史(标准化)的回归系数β=-0.112(SE=0.183,z=-0.612,Wald χ²=0.375,p=0.541),OR=0.894,95%CI为[0.625, 1.280],置信区间包含1且p值远大于0.05,表明吸烟史对患病的影响不具有统计显著性。综上,年龄和BMI是疾病的核心危险因素,家族史为次要风险因素,而吸烟史在本样本中未显示出显著影响。

表3 Firth惩罚Logit回归分析结果汇总
2.3 模型预测准确率与辅助检验
表4展示了模型的分类预测表现。模型整体预测准确率为82.000%,其中对未患病类别的预测准确率(特异度)为92.763%,对患病类别的预测准确率(敏感度)为47.917%。由于患病为少数类别(24%),其敏感度相对偏低是可以预期的,但整体准确率仍达到较高水平。

表4 Firth惩罚Logit回归预测准确率汇总
表5以简化格式汇总了回归分析结果,表6为样本缺失情况汇总,显示有效样本为200份,无缺失值。表7报告了多重共线性诊断结果,各变量的VIF值均接近1(1.005~1.017),远低于10的临界阈值,容忍度均大于0.98,表明自变量之间不存在多重共线性问题,回归系数估计稳定可靠。

表5 Firth惩罚Logit回归分析结果(简化格式)
3 可视化
图1至图3展示了Firth惩罚Logistic回归模型的路径系数图、OR值置信区间森林图等可视化结果,直观呈现了各变量对患病风险的影响方向与强度。

图1 Firth惩罚Logit回归可视化结果

图2 Firth惩罚Logit回归可视化结果

图3 Firth惩罚Logit回归可视化结果
4 结论
本研究基于200名居民的健康体检数据,借助SPSSAU在线数据分析平台完成Firth惩罚Logistic回归分析,考察了年龄、BMI、吸烟史和家族史对疾病发生的影响。研究结果表明,年龄(OR=3.993,p<0.001)和BMI(OR=2.446,p<0.001)是疾病的核心危险因素,家族史具有次要风险效应(OR=1.562,p=0.026),而吸烟史未显示出显著影响(p=0.541)。模型整体通过似然比检验(χ²=75.889,p<0.001),预测准确率为82.000%,且不存在多重共线性问题,分析结果稳健可靠。

浙公网安备 33010602011771号