半监督学习介绍

半监督学习

image-20260915110533448

image-20260915110646564

image-20260915111207211

image-20260915111407758

image-20260915111452128

image-20260915111452128

image-20260915111959305

image-20260915112345357

Semi-supervised Learning Low-density Separation 非黑即白

image-20260915112818597

image-20260915113131962

错误标记 30% class2

neural network use hard label is best

在机器学习与半监督学习(如 Self-training)中,Hard Label(硬标签)Soft Label(软标签) 代表对数据类别描述的两种不同形式:

  • Hard Label(硬标签):一种确定的、独热编码(One-Hot Encoding)的形式。它只明确指定唯一的正确类别(概率为 1),其他类别概率均归零。
    • 例子:如图片中所示,当模型预测无标签数据 $x^u$ 的概率输出为 $[0.7, 0.3]^T$ 时,Hard Label 会直接取概率最大的类别(Class 1),将其转换为离散标签 $[1, 0]^T$。
    • 特点:非黑即白,明确判定属于某类,抹除了不同类别之间的模糊度或不确定性。
  • Soft Label(软标签):一种连续的、概率分布(Probability Distribution)的形式。它保留了模型对各个类别的置信度和类别间的相似性信息。
    • 例子:如图片中所示,直接将模型输出的软概率概率分布 $[0.7, 0.3]^T$ 作为新目标(即 70% 属于 Class 1,30% 属于 Class 2)。
    • 特点:包含更多“软信息”(暗知识/Dark Knowledge),表达了分类的模糊度与相对相似度。

核心区别对比

特性 Hard Label (硬标签) Soft Label (软标签)
表示形式 离散向量(如 $[1, 0]$) 连续概率分布(如 $[0.7, 0.3]$)
信息量 仅包含“最终类别” 包含“类别间相似度”与“不确定性”
主要应用场景 标准分类任务、Self-training 伪标签 生成 知识蒸馏(Knowledge Distillation)、 Label Smoothing

图片中 Self-training 场景的补充说明

​ 在神经网络的自训练(Self-training)中,通常使用 Hard Label 效果更好。因为如果直接使用 Soft Label,将模型的预测输出 $[0.7, 0.3]^T$ 作为下一轮训练的目标向量,在交叉熵损失函数下,这种方式无法为神经网络更新提供有效的梯度方向(模型已经处于预测收敛点),无法让神经网络从无标签数据中学到新信息;而转为 Hard Label $[1, 0]^T$ 相当于注入了明确的监督信号,迫使模型去强化对该类别的置信度。

image-20260915114447023

Loss 加上 unlabeled data

image-20260915114732210

显而易见 第二个 分类概率最大

Semi-supervised Learning Smoothness Assumption 近朱者赤近墨者黑

近朱者赤近墨者黑

image-20260915120143366

image-20260915120502667

image-20260915120639294

image-20260915120849073

image-20260915121211175

image-20260915121445530

image-20260915121950883

​ 基于图的半监督学习(Graph-based Semi-Supervised Learning)核心思想是利用少量有标签数据和大量无标签数据构建图结构,通过“相似的数据点在图上有边连接”这一假设,将标签信息沿着图的边传播给无标签数据(如右图双月数据集所示)。

实现该方法主要分为 构图计算边权重标签传播/图正则化 三个步骤:

1. 图的构建 (Graph Construction)

将每个数据点 $x_i$ 视作图中的一个节点 $V_i$。常见的建图方式有:

  • k-NN 图(常用):如果 $x_j$ 是 $x_i$ 的 $k$ 个最近邻之一,则在两点间连一条边。
  • $\epsilon$-邻域图:计算两点间的欧式距离 $d(x_i, x_j)$,若距离小于阈值 $\epsilon$,则建立连边。

2. 相似度/边权重计算 (Weight Matrix Calculation)

建立连边后,需要为每条边赋予权重 $W_{ij}$,数据点越相似,权重越大。最常用的是高斯核函数(RBF Kernel):

$$W_{ij} = \exp\left( -\frac{\Vert{}x_i - x_j\Vert{}2}{2\sigma2} \right)$$

若两点未连通,则 $W_{ij} = 0$。由此可得到对称的权值矩阵 $W$。

3. 标签传播与优化求解 (Label Propagation / Optimization)

实现标签传播(如 Label Propagation Algorithm, LPA)有两种主流方式:

方式 A:迭代传播算法 (Iterative Propagation)

  1. 构造概率转移矩阵 $P$:对权值矩阵按行归一化,$P_{ij} = \frac{W_{ij}}{\sum_k W_{ik}}$,表示节点 $i$ 传播标签给节点 $j$ 的概率。

  2. 迭代更新:设矩阵 $Y$ 记录所有节点的标签概率向量,每一轮进行矩阵乘法:

    $$Y^{(t+1)} = P \cdot Y^{(t)}$$

  3. 重置有标签节点:将有标签节点的预测值硬性重置为其真实标签(保证已知标签不被覆盖)。

  4. 重复以上过程直到收敛,最终无标签节点的标签即为其对应的最高概率类。

方式 B:平滑度目标函数 (Graph Laplacian Regularization)

定义图拉普拉斯矩阵 $L = D - W$(其中 $D$ 是度矩阵,$D_{ii} = \sum_j W_{ij}$),通过最小化以下损失函数直接求解流形平滑约束:

image-20260915122905615

​ $$E(f) = \sum_{i,j} W_{ij} \Vert{}f_i - f_j\Vert{}^2 = 2 f^T L f$$

  • 含义:若 $W_{ij}$ 很大(两点很近),则预测值 $f_i$ 与 $f_j$ 的差距必须尽量小,从而实现了标签在密集流形上的自然流动与平滑过渡。

image-20260915122512155

image-20260915123351688

Semi-supervised Learning Better Representation 无中生有 化繁为简

即无监督学习

posted @ 2026-09-15 16:04  Yang0710  阅读(5)  评论(0)    收藏  举报