Paper Reading: Towards Class-Imbalance Aware Multi-Label Learning
Paper Reading 是从个人角度进行的一些总结分享,受到个人关注点的侧重和实力所限,可能有理解不到位的地方。具体的细节还需要以原文的内容为准,博客中的图表若未另外说明则均来自原文。
| 论文概况 | 详细 |
|---|---|
| 标题 | 《Towards Class-Imbalance Aware Multi-Label Learning》 |
| 作者 | Min-Ling Zhang, Yu-Kun Li, Hao Yang, Xu-Ying Liu |
| 发表期刊 | IEEE Transactions on Cybernetics |
| 发表年份 | 2022 |
| 期刊等级 | 中科院 SCI 期刊分区(2022年12月最新升级版)1 区,CCF-B |
| 论文代码 | 文中未公开 |
作者单位:
- School of Computer Science and Engineering, Southeast University, Nanjing 210096, China
- Key Laboratory of Computer Network and Information Integration (Southeast University), Ministry of Education, China
- Business Group of Natural Language Processing, Baidu Inc., Beijing 100085, China.
研究动机
多标签学习广泛应用于文本分类、图像标注、基因功能预测等现实场景,其核心挑战在于输出空间巨大。例如对于一个包含 \(q\) 个标签的系统,可能的标签子集有 \(2^q\) 个。因此,现有方法普遍认为需要有效利用标签之间的相关性来设计预测模型。但是,类别不平衡是多标签数据的内在属性,数据集中的每一个类别标签的正例样本的数量通常远少于负例样本,这会严重影响多标签预测模型的泛化性能。已有一些方法尝试解决多标签学习中的不平衡问题,例如将多标签问题分解为独立的二元问题后应用过采样、欠采样或调整阈值等传统不平衡学习技术,或者通过标签集转换等方式,但它们通常未能同时且有效地处理标签相关性的利用和类别不平衡这两个方面。基于以上背景,本文旨在解决的核心问题是:如何设计一个有效的多标签学习方法,使其能够同时考虑并处理标签相关性与类别不平衡这两个关键因素,从而提升模型在不平衡数据上的泛化性能,特别是在关注少数类(正例)性能的指标上。
文章贡献
多标签学习中的类别不平衡是一个固有但常被忽视的挑战,针对这个问题,本文提出了一种名为交叉耦合聚合 COCOA 的学习策略。该方法的核心是为每个目标标签构建预测模型时,不再独立学习,而是通过与多个随机选择的其他标签进行交叉耦合来同时解决两个关键问题。具体而言,对于每个目标标签 \(y_j\),算法会:1)随机选择 \(K\) 个其他标签与之配对;2)为每一对标签 \((y_j, y_k)\) 构建一个三分类数据集;3)在每个三分类数据集上训练一个多类别不平衡分类器;4)将 \(K\) 个分类器给出的、关于“\(y_j\) 为正”的预测置信度进行简单平均求和,作为 \(y_j\) 的最终预测得分;5)通过最大化该标签在训练集上的 F-measure 来确定其最优分类阈值。整个过程通过对多个随机耦合分类器的集成,利用了高阶标签相关性,并通过专门针对不平衡指标的阈值进行校准。大量实验的实验验证了 COCOA 的性能,其效果优于基于相关性或频率的加权方案。
预备知识
多标签学习处理的是每个对象由单个实例表示,但关联有多个类别标签的问题。形式上,令 $ \mathcal{X} = \mathbb{R}^d $ 为实例空间,$ \mathcal{Y} = {y_1, y_2, ..., y_q} $ 为由 $ q $ 个类别标签组成的标签空间。任务是从训练集 $ \mathcal{D} = { (x_i, Y_i) | 1 \le i \le N } $ 中学习一个预测模型 $ h: \mathcal{X} \rightarrow 2^{\mathcal{Y}} $,为未见实例 $ x $ 返回其相关标签的集合 $ h(x) $。多标签学习的核心挑战是巨大的输出空间,模型需要考虑 $ 2^q $ 个可能的标签子集进行预测。根据所考虑的相关性阶数,现有方法大致可分为三类:
| 多标签学习方法 | 说明 |
|---|---|
| 一阶方法 | 假设标签间相互独立,为每个标签单独训练一个二分类器,例如二元关联法 BR |
| 二阶方法 | 考虑成对标签之间的相关性,例如,考虑相关标签应比不相关标签排名更高,或利用高共现率的标签对 |
| 高阶方法 | 考虑所有标签或标签子集之间的相关性 |
尽管利用标签相关性至关重要,但类别不平衡作为多标签数据的一个内在属性,同样需要被充分考虑。对于每个标签 $ y_j $,其正例样本集 $ \mathcal{D}_j^+ $ 的大小通常远小于负例样本集 $ \mathcal{D}_j^- $ 的大小。这种偏斜性可以用不平衡比来衡量:
本文方法
多标签学习的任务通常是学习一组模型 fj:X→ R(1≤j≤q)来实现,其中 fj(x) 输出的是将样本 x∈X 预测为标签 yj 的置信度。结合阈值函数 tj:X→ R,就可以得到如下公式所示的输出的标签集合。

一种直接的方法是将数据集只按照第 j 个类标签 yj 生成一个二分类训练集 Dj,利用 Dj 来分别训练模型 fj(·),如下面的公式所示。导出的二分类训练集由正样本 D+j 和负样本 D-j 组成,由于正样本和负样本的数量是不平衡的,一种简单的解决方案是在 Dj 上应用一些二分类不平衡学习器 B 来训练模型得到 gj←B(Dj)。这样就可以令 fj(x)=gj(+1|x),其中 gj(+1|x)表示样本 x 被分类为正类的置信度。

虽然上述方案是可行的,但每个类标签 yj 的预测模型 fj(·) 彼此之间相互独立。为了更好地利用标签相关性,COCOA 考虑将随机类别标签 yk(k↑=j) 与 yj 通过交叉进行耦合,也就是对给定标签对 (yj,yk),可利用如下公式从 D 得到多类训练集 Djk。

但是如果使用 Djk 来利用标签的相关性,可能会加剧类不平衡的问题。在不失一般性的情况下,假设正类 D+j(或 D+k) 是二分类训练集 Dj(或 Dk)中的少数类,对于四类训练集 Djk 中的第一类 (ψ(Yi,yk,yks)=0)和第四类 (ψ(Yi,yk,yk)=+3) 将分别包含最多和最少的示例。与二分类训练集 Dj 和 Dk 中的不平衡比 ImRj 和 ImRk 相比,Djk 中多数类和少数类之间的不平衡率将大致增加到 ImRj·ImRk。
为了解决这个潜在的问题,COCOA 通过合并第三类和第四类(均为 yj 的正值),将四类数据集 Djk 转换为三分类数据集 Dtrijk,如下公式所示。对于新合并的类(ψtri(Yi, yj, yk) = +2),其与其他两类 (ψtri(Yi,yj,yk)= 0) 和 (ψtri(Yi,yj,yk)=+1) 的不平衡比大致为 [(ImRj·ImRk)/(1+ImRk)] 和 [ImRj/(1+ImRk)],远远小于四分类训练集中最坏情况下的不平衡比率。

利用 Dtrijk 训练某种机器学习模型,可得到一个多类分类器 gjk←M(Dtrijk)。设 gjk (+2|x) 表示样本 x 在 yj 上被预测为正类的预测置信度。对于每个类标签 yj,COCOA 将生成 K 个类标签 Ik 的随机子集,用于两两交叉耦合,然后通过集成 K 个多类不平衡学习器的预测置信度作为函数 fj(·) 的输出,如下公式所示。

在得到实值置信度 \(f_j(x)\) 后,需要一个阈值将其转换为二分类决策,即判断 \(y_j\) 是否与 \(x\) 相关。COCOA 选择了一个常数阈值 \(a_j\),并通过优化 F-measure 来确定它。\(F\left(f_{j}, a,\mathcal{D}_{j}\right)\) 表示当使用阈值 \(a\) 对函数 \(f_j\) 在数据集 \(\mathcal{D}_j\) 上的预测结果进行二值化时,所得到的 F1 指标值。在类别不平衡(正例少,负例多)的场景下,Accuracy 是不合适的,因为模型将所有样本都预测为负例也能获得很高的准确率。F-measure 综合了精确率和召回率,特别关注少数类的识别效果,是评估不平衡学习模型性能的经典指标。通过直接最大化 F-measure 来设定阈值,确保了模型朝着优化不平衡分类性能的方向进行。

接着确定最优阈值,对于标签 \(y_j\),我们从所有可能的实数值 \(a\) 中,选择一个能使 \(F\left(f_j, a,\mathcal{D}_j\right)\) 这个函数值最大的 \(a\),并将其定为该标签的最终分类阈值 \(a_j\)。实际操作中,通常会在 \(f_j(\cdot)\) 在所有训练样本上输出值的值域范围内进行搜索,例如排序后遍历,找到使 F1 值最高的那个分割点。

最终,对于任何测试样本 \(x\),判断 \(y_j\) 是否相关的决策规则为:$\text{如果 } f_j(x) > a_j, \text{ 则预测 } y_j \text{ 与 } x \text{ 相关 } $。本文方法的伪代码如下所示:

实验结果
数据集和实验设置
本文使用了 18 个基准多标签数据集,覆盖文本、音频、图像、视频、生物学等多个领域,数据集的基本信息如下:

实验对比了两大类算法,类别不平衡多标签学习算法包括:
| 类别不平衡多标签学习算法 | 说明 |
|---|---|
| ThRSEL | 将问题分解为 q 个二分类问题,并在验证集上通过最大化 F-measure 来调整阈值 |
| IRUs | 同样进行二元分解,但对每个二分类问题中的多数类进行随机欠采样,并重复多次以集成分类器 |
| SMOTE-EN | 对每个二分类问题中的少数类使用 SMOTE 过采样,并采用集成版本 |
| RML | 一种通过凸松弛直接优化宏平均 F-measure 的多标签学习方法 |
经典多标签学习算法包括:
| 经典多标签学习算法 | 说明 |
|---|---|
| BR | 一阶方法,独立为每个标签训练二分类器 |
| CLR | 二阶方法,考虑标签对的排序关系 |
| ECC | 高阶方法,集成多个随机链式分类器 |
| RAKEL | 高阶方法,在随机选择的标签子集上构建多分类器并集成 |
为了全面评估,本文使用了以下指标。所有数据集按 50/50 随机划分为训练集和测试集,重复 10 次报告平均性能与标准差。COCOA 使用 C4.5 配合欠采样作为多类别不平衡学习器 \(\mathcal{M}\),耦合标签数 \(K = \min(q-1, 10)\)。其他算法的实现主要基于 MULAN 库和原始论文提供的代码,并采用建议的默认或典型参数。
| 评估指标 | 说明 |
|---|---|
| 宏平均 F-measure (\(F_{\text{macro}}\)) | 对每个标签计算 F1 值后取平均,对少数类(正例)性能敏感,值越大越好。 |
| 宏平均 AUC (\(AUC_{\text{macro}}\)) | 对每个标签计算 ROC 曲线下面积后取平均,衡量模型将正例排在负例之前的能力,值越大越好。 |
| 排序损失 RL | 衡量相关标签被排在无关标签之后的平均比例,值越小越好。 |
| 平均精度 AP | 衡量对于每个样本,其每个相关标签的排名高于其他相关标签的平均比例,值越大越好。 |
对比实验
COCOA 在 18 个数据集中的 10 个上的 \(F_{\text{macro}}\) 取得了最佳性能,在 6 个上取得次优性能,平均排名第一(1.72)。统计检验表明,COCOA在 \(F_{\text{macro}}\) 上显著优于所有其他对比算法,包括专门优化 F-measure 的 RML。

COCOA 在 10 个数据集的 \(AUC_{\text{macro}}\) 上最佳,5 个上次优,平均排名第一(1.64)。统计检验表明,COCOA 显著优于 BR、ThRSEL、SMOTE-EN 和 RAKEL,但与 CLR 和 ECC 性能相当,说明 COCOA 在排序性能(区分正负例)上同样极具竞争力。

COCOA 在 RL 和 AP 这些经典指标上也表现优异,平均排名分别位列第三(2.25) 和第二(2.03),仅次于 ECC 等专门优化排序的算法。统计检验表明,COCOA 的性能与 CLR、ECC 相当,并优其他算法。表明 COCOA 在提升不平衡分类性能的同时,并未牺牲其整体的多标签排序能力。


COCOA 的优势在大规模数据集和标签数较少的数据集上更为明显,但在标签数极多(如 CAL500)的数据集上,其排序性能可能略有下降,这可能是随机耦合策略在超高维标签空间中的局限性。
变体对比
该部分涉及到的变体算法如下:
| 变体算法 | 说明 |
|---|---|
| COCOA-V1 | 在置信度聚合中引入权重,根据耦合标签 \(y_k\) 在训练集中出现的频率进行加权,而非简单平均。 |
| COCOA-V2 | 改变随机耦合策略,为每个 \(y_j\) 选择与其最相关(共现最多)的 K 个标签进行耦合,而非随机选择。 |
| REMEDIAL | 引入一个近期提出的、同样利用标签共现来处理不平衡的方法进行对比。 |
在大多数情况下,原始 COCOA(等权聚合)优于或等同于加权版本 V1,表明简单平均是更鲁棒有效的聚合策略。原始 COCOA(随机耦合)优于或等同于基于相关性的耦合版本 V2,验证了随机性增加了基学习器的多样性,有助于集成模型的泛化,避免了过拟合于最强的标签相关性。COCOA 在绝大多数情况下显著优于 REMEDIAL,表明 COCOA 的“构建三分类问题 + 集成”策略,比简单地利用标签共现进行重采样或编辑更为有效。

优点和创新点
个人认为,本文有如下一些优点和创新点可供参考学习:该方法首次通过随机交叉耦合构建三分类问题并集成的简单机制,将标签相关性的利用与类别不平衡问题的处理统一在一个学习流程中,实现了两者的协同优化。所提出的 COCOA 算法设计简洁,不依赖复杂优化,但优于所有对比的算法。通过消融实验有力验证了随机耦合与等权聚合设计的合理性与鲁棒性,为该类方法的设计提供了重要洞见。

浙公网安备 33010602011771号