二元Logit回归结果解读:系数估计、OR值与ROC曲线
二元Logit回归分析结果解读
一、方法概述
二元Logit回归(Binary Logistic Regression)是研究二分类因变量与一个或多个解释变量之间关系的经典统计方法。其核心思想是通过Logit变换将事件发生概率映射到实数域,建立线性预测模型:ln(p/(1-p)) = beta_0 + beta_1*x_1 + ... + beta_k*x_k,其中p为事件发生概率,beta为回归系数。模型输出的OR值(Odds Ratio,优势比)可直接解释为自变量每增加1个单位时事件发生胜算的变化倍数,是医学、社会科学和市场研究中广泛应用的效应量指标。
二元Logit回归分析的结果评价涉及多个维度:模型整体显著性(似然比检验)、拟合优度(Hosmer-Lemeshow检验、伪R方)、各变量的OR值及其置信区间、预测准确率和边际效应等。
SPSSAU软件提供了完整的二元Logit回归分析流程,涵盖模型估计、显著性检验、预测评价、共线性诊断和边际效应计算等功能,可为研究者提供系统化的二分类结局分析支持。
在SPSSAU【进阶方法】模块选择【二元logit】,将变量拖拽至右侧对应分析框,操作如下图:

二、因变量分布与样本情况
表1报告了因变量的类别分布和样本缺失情况。因变量y分为0类和1类两个取值,其中0类143例(44.69%),1类177例(55.31%),总计320例,无缺失样本。

因变量两类比例分别为44.69%和55.31%,比例接近1:1,未出现极端失衡(如90%:10%),因此模型估计不太容易受到严重样本倾斜的影响。在这种情况下,OR值和分类准确率能够较为客观地反映变量与结局之间的真实关系。320个有效样本对于包含4个解释变量的Logit模型而言,样本量充足,可满足事件数 per variable(EPV)大于10的基本要求。
三、模型整体显著性检验
表2报告了模型似然比检验结果,用于判断包含解释变量的完整模型是否显著优于仅含截距的空模型。

最终模型的-2倍对数似然值(-2LL)为274.057,较仅截距模型的439.995大幅下降165.938。似然比卡方检验结果为chi²(4)=165.938,p<0.001,表明加入解释变量后模型拟合显著改善,模型整体具有高度统计显著性。
AIC值为284.057,BIC值为302.898。这两个信息准则本身没有绝对优劣阈值,但在比较不同备选模型时,数值更小者代表拟合与简约性的综合表现更优。当前AIC和BIC值可作为后续模型比较的基准参考。
四、回归系数与OR值解读
表3报告了二元Logit回归的核心结果,包括各变量的回归系数、标准误、Wald卡方值、p值、OR值及95%置信区间。

x1的回归系数为1.906(z=7.967, p<0.001),OR值为6.723(95%CI: [4.207, 10.744])。OR值远大于1且置信区间不跨越1,说明x1是显著的危险因素:x1每增加1个单位,结局事件发生的胜算(odds)提高约5.7倍(即OR-1=5.723)。该变量的Wald卡方值为63.469,是所有变量中最大的,表明x1对模型的解释贡献最为突出。
x2的回归系数为1.057(z=5.777, p<0.001),OR值为2.877(95%CI: [2.010, 4.117])。OR值大于1且置信区间不跨越1,说明x2同样是显著的危险因素:x2每增加1个单位,结局事件发生的胜算提高约1.9倍。x2的Wald卡方值为33.378,贡献仅次于x1。
x3的回归系数为-0.734(z=-4.328, p<0.001),OR值为0.480(95%CI: [0.344, 0.669])。OR值小于1且置信区间不跨越1,说明x3是显著的保护因素(或抑制因素):x3每增加1个单位,结局事件发生的胜算降低约52%(即1-0.480=0.520)。这一结果表明x3对结局事件具有明显的抑制效应。
x4为分类变量,以0为参照组,1类的回归系数为0.597(z=1.967, p=0.049<0.05),OR值为1.816(95%CI: [1.002, 3.290])。OR值大于1且置信区间下限刚好不跨越1(1.002),说明x4=1相对于x4=0,结局事件发生的胜算提高约81.6%。该变量的显著性处于边界水平(p=0.049),解释时需注意其统计证据相对较弱。
模型伪R方结果显示,McFadden R²=0.377,Cox & Snell R²=0.405,Nagelkerke R²=0.542。其中Nagelkerke R²=0.542表明模型解释了因变量约54.2%的变异,拟合效果良好。McFadden R²在0.2-0.4之间通常被认为代表了非常好的拟合,当前0.377已接近该范围上限。
五、模型预测准确率
表4报告了模型的分类预测结果,展示了模型对两类样本的判别能力。

模型总体预测准确率为77.50%,即320个样本中有248个被正确分类。其中,y=0类样本的预测准确率为72.03%(103/143),y=1类样本的预测准确率为81.92%(145/177)。模型对1类样本的识别能力优于0类样本,两类准确率之差约10个百分点。
从误分类情况来看,40个实际为0类的样本被错误预测为1类(假阳性),32个实际为1类的样本被错误预测为0类(假阴性)。假阳性数量略高于假阴性,说明模型在判定0类时存在一定的保守倾向。总体而言,77.50%的预测准确率在社会科学和医学研究中属于中等偏上水平,模型具有一定的实际应用价值。
六、Hosmer-Lemeshow拟合优度检验
表5报告了Hosmer-Lemeshow检验结果,该检验通过将样本按预测概率分组,比较各组的观测频数与期望频数来评估模型拟合质量。

Hosmer-Lemeshow检验的卡方值为8.799(df=8, p=0.360>0.05),未达到显著水平,说明模型预测概率与实际观测频率之间不存在系统性偏离,模型拟合质量良好。与回归系数的显著性检验不同,Hosmer-Lemeshow检验的零假设是模型拟合良好,因此p值不显著反而是有利结果。

从分组详情来看,大部分组别的观测频数与期望频数较为接近。在低概率组(0-10%),观测到32个y=0样本,期望31.145;在高概率组(90-100%),观测到32个y=1样本,期望31.507。中间概率组中,(30-40%)组的观测与期望差异相对最大(观测y=0为13,期望19.178),但整体偏差不构成系统性失配。
七、边际效应分析
OR值虽然直观,但其解释基于胜算(odds)尺度,不如概率变化直观。边际效应将回归系数转换为概率变化量,更便于实际解释。表7报告了各变量的平均边际效应。

x1的平均边际效应为0.266(z=14.547, p<0.001, 95%CI: [0.230, 0.301]),意味着在其他条件不变时,x1每增加1个单位,结局取1的概率平均提高约26.6个百分点。x1的边际效应最大,是模型中最具实际影响力的变量。
x2的平均边际效应为0.147(z=7.323, p<0.001, 95%CI: [0.108, 0.187]),x2每增加1个单位,结局概率平均提高约14.7个百分点。x3的平均边际效应为-0.102(z=-4.867, p<0.001, 95%CI: [-0.144, -0.061]),x3每增加1个单位,结局概率平均降低约10.2个百分点。x4(1 vs 0)的平均边际效应为0.084(z=1.995, p=0.046, 95%CI: [0.001, 0.166]),x4从0变为1时,结局概率平均提高约8.4个百分点。
边际效应的排序为:x1(0.266)> x2(0.147)> x3(|-0.102|)> x4(0.084),与OR值的排序一致。这一结果建议在实际应用中应优先关注x1的变化,其对结局概率的影响最为显著。
八、共线性诊断
共线性诊断用于评估解释变量之间是否存在高度相关,以避免参数估计不稳定。表8报告了各变量的VIF值和容忍度。

各变量的VIF值介于1.008至1.017之间,远低于常见的风险阈值(VIF>5或VIF>10),容忍度均在0.98以上。这说明各解释变量之间几乎不存在多重共线性问题,每个变量在模型中提供的是相对独立的信息。因此,OR值和边际效应的估计具有较好的稳定性,各变量的效应可以独立解释。
九、图形结果解读
图1为二元Logit回归分析的核心结果图,展示了各变量的OR值及其95%置信区间。从图中可直观观察到,x1的OR值(6.723)远高于其他变量,其置信区间范围较宽(4.207~10.744),反映其效应量大但估计精度相对有限。x2的OR值为2.877,x3的OR值为0.480(小于1,为保护因素),x4的OR值为1.816。图中以OR=1的虚线作为无效线,各变量的置信区间均未跨越该线(x4下限刚好触及),与表格中的显著性检验结果一致。

图1 二元Logit回归OR值森林图
图2为模型预测概率分布图,展示了模型对两类样本的预测概率分布。从图中可观察到,1类样本的预测概率普遍集中在0.5以上的高概率区域,0类样本的预测概率则分布在较宽的范围内,部分0类样本的预测概率也较高,这与72.03%的0类预测准确率相对应。图形结果直观反映了模型对两类样本的区分能力。

图2 模型预测概率分布图
图3为补充可视化结果,可能包括ROC曲线或分类效果图。若为ROC曲线,曲线下面积(AUC)可综合衡量模型对所有可能分类阈值下的判别能力,AUC越接近1表示模型区分能力越强。结合77.50%的总体预测准确率,模型的判别效果处于中等偏上水平。

图3 二元Logit回归补充可视化
十、结论
本研究采用二元Logit回归分析考察了4个解释变量对二分类结局的影响。模型整体显著(似然比卡方=165.938, p<0.001),Nagelkerke R²=0.542,拟合效果良好。x1是最强的危险因素(OR=6.723, 95%CI: [4.207, 10.744], 边际效应=0.266),x2也是显著的危险因素(OR=2.877, 95%CI: [2.010, 4.117], 边际效应=0.147),x3是显著的保护因素(OR=0.480, 95%CI: [0.344, 0.669], 边际效应=-0.102),x4的分类效应在边界显著水平上达到显著(OR=1.816, p=0.049)。模型总体预测准确率为77.50%,Hosmer-Lemeshow检验不显著(p=0.360),拟合质量良好。各变量VIF值均接近1,不存在共线性问题。综合来看,x1对结局事件的影响最为突出,其次为x2和x3,x4的影响相对较弱。

浙公网安备 33010602011771号