半监督学习介绍
半监督学习








Semi-supervised Learning Low-density Separation 非黑即白


错误标记 30% class2
neural network use hard label is best
在机器学习与半监督学习(如 Self-training)中,Hard Label(硬标签) 与 Soft Label(软标签) 代表对数据类别描述的两种不同形式:
- Hard Label(硬标签):一种确定的、独热编码(One-Hot Encoding)的形式。它只明确指定唯一的正确类别(概率为 1),其他类别概率均归零。
- 例子:如图片中所示,当模型预测无标签数据 $x^u$ 的概率输出为 $[0.7, 0.3]^T$ 时,Hard Label 会直接取概率最大的类别(Class 1),将其转换为离散标签 $[1, 0]^T$。
- 特点:非黑即白,明确判定属于某类,抹除了不同类别之间的模糊度或不确定性。
- Soft Label(软标签):一种连续的、概率分布(Probability Distribution)的形式。它保留了模型对各个类别的置信度和类别间的相似性信息。
- 例子:如图片中所示,直接将模型输出的软概率概率分布 $[0.7, 0.3]^T$ 作为新目标(即 70% 属于 Class 1,30% 属于 Class 2)。
- 特点:包含更多“软信息”(暗知识/Dark Knowledge),表达了分类的模糊度与相对相似度。
核心区别对比
| 特性 | Hard Label (硬标签) | Soft Label (软标签) |
|---|---|---|
| 表示形式 | 离散向量(如 $[1, 0]$) | 连续概率分布(如 $[0.7, 0.3]$) |
| 信息量 | 仅包含“最终类别” | 包含“类别间相似度”与“不确定性” |
| 主要应用场景 | 标准分类任务、Self-training 伪标签 生成 | 知识蒸馏(Knowledge Distillation)、 Label Smoothing |
图片中 Self-training 场景的补充说明
在神经网络的自训练(Self-training)中,通常使用 Hard Label 效果更好。因为如果直接使用 Soft Label,将模型的预测输出 $[0.7, 0.3]^T$ 作为下一轮训练的目标向量,在交叉熵损失函数下,这种方式无法为神经网络更新提供有效的梯度方向(模型已经处于预测收敛点),无法让神经网络从无标签数据中学到新信息;而转为 Hard Label $[1, 0]^T$ 相当于注入了明确的监督信号,迫使模型去强化对该类别的置信度。

Loss 加上 unlabeled data

显而易见 第二个 分类概率最大
Semi-supervised Learning Smoothness Assumption 近朱者赤近墨者黑
近朱者赤近墨者黑







基于图的半监督学习(Graph-based Semi-Supervised Learning)核心思想是利用少量有标签数据和大量无标签数据构建图结构,通过“相似的数据点在图上有边连接”这一假设,将标签信息沿着图的边传播给无标签数据(如右图双月数据集所示)。
实现该方法主要分为 构图、计算边权重 和 标签传播/图正则化 三个步骤:
1. 图的构建 (Graph Construction)
将每个数据点 $x_i$ 视作图中的一个节点 $V_i$。常见的建图方式有:
- k-NN 图(常用):如果 $x_j$ 是 $x_i$ 的 $k$ 个最近邻之一,则在两点间连一条边。
- $\epsilon$-邻域图:计算两点间的欧式距离 $d(x_i, x_j)$,若距离小于阈值 $\epsilon$,则建立连边。
2. 相似度/边权重计算 (Weight Matrix Calculation)
建立连边后,需要为每条边赋予权重 $W_{ij}$,数据点越相似,权重越大。最常用的是高斯核函数(RBF Kernel):
$$W_{ij} = \exp\left( -\frac{\Vert{}x_i - x_j\Vert{}2}{2\sigma2} \right)$$
若两点未连通,则 $W_{ij} = 0$。由此可得到对称的权值矩阵 $W$。
3. 标签传播与优化求解 (Label Propagation / Optimization)
实现标签传播(如 Label Propagation Algorithm, LPA)有两种主流方式:
方式 A:迭代传播算法 (Iterative Propagation)
-
构造概率转移矩阵 $P$:对权值矩阵按行归一化,$P_{ij} = \frac{W_{ij}}{\sum_k W_{ik}}$,表示节点 $i$ 传播标签给节点 $j$ 的概率。
-
迭代更新:设矩阵 $Y$ 记录所有节点的标签概率向量,每一轮进行矩阵乘法:
$$Y^{(t+1)} = P \cdot Y^{(t)}$$
-
重置有标签节点:将有标签节点的预测值硬性重置为其真实标签(保证已知标签不被覆盖)。
-
重复以上过程直到收敛,最终无标签节点的标签即为其对应的最高概率类。
方式 B:平滑度目标函数 (Graph Laplacian Regularization)
定义图拉普拉斯矩阵 $L = D - W$(其中 $D$ 是度矩阵,$D_{ii} = \sum_j W_{ij}$),通过最小化以下损失函数直接求解流形平滑约束:

$$E(f) = \sum_{i,j} W_{ij} \Vert{}f_i - f_j\Vert{}^2 = 2 f^T L f$$
- 含义:若 $W_{ij}$ 很大(两点很近),则预测值 $f_i$ 与 $f_j$ 的差距必须尽量小,从而实现了标签在密集流形上的自然流动与平滑过渡。


Semi-supervised Learning Better Representation 无中生有 化繁为简
即无监督学习
本文来自博客园,作者:Yang0710,转载请注明原文链接:https://www.cnblogs.com/cwyYYDS/articles/22983906

浙公网安备 33010602011771号