自监督与表示学习论文精读

自监督学习(SSL) 与 表示学习(Representation Learning) 这一大类,核心目标是 不依赖或极少依赖人工标注,从图像、视频、点云、信号等数据中自动学到可迁移、可泛化的视觉/多模态表征。
一、趋势
自监督与表示学习是当前视觉乃至多模态大模型的"发动机"。这次在2026CVPR的论文集中体现了四个趋势和意义。

① 范式演进:
早些年流行"对比学习"——给模型看两张图,告诉它"这是同一个东西的不同视角",同时把不像的推开。后来变成"掩码建模"——把图盖住一块,让模型猜被盖住的是啥(MAE 就是这么干的)。现在又在往"生成式预训练 + 码本"走,把"生成图像"和"学特征"用同一套预训练搅到一块。

② 基础模型工业化:
怎么用更少的算力把视觉大模型训出来、压小、开源、部署,成了热点。比如有论文做训练加速,有做高效注意力,还有全开源的视觉基础模型。
③ 开放世界学习能力:
现实里的数据不是打包好的,它是"不停来新东西、有新类、跨领域、长尾、样本少"的。所以持续学习、类别发现、少样本、长尾这些方向占了一大块,是这批论文的重头戏。
④ 表征本质的反思:
不止堆方法了,有些论文在诊断自监督学到的特征为什么会翻车——比如残差连接会不会偷偷压制语义、噪声是不是混进了非语义的信息、特征的几何形状对不对。这个转向我个人挺喜欢,说明领域在从"堆积"往"理解"走。

二、方法
各种方法之间是叠加而非替代关系——一篇论文常常同时用多种方法,例如"掩码建模 + 基础模型 + 高效化"或"对比 + 类别发现 + 最优传输"。真正的分歧不在"用不用 SSL",而在"用哪一种自监督信号 + 怎么接下游任务"。

生成式 & 蒸馏预训练(约 23%):最多,基本就是说的"生成式预训练"。
持续 & 类增量学习(约 22%):模型要不停学新类还不忘旧的,开放世界部署的刚需。
3D & 点云、对比学习 & 聚类、掩码建模:各约 20%,三足鼎立。
再往下是 CLIP/多模态、视频时序、架构高效化、视觉基础模型 等等。

三、主题
可以把这些论文分为13类,每一类都有其不同的应用场景。

A. 掩码图像 / 视频建模
简述:用“遮盖—重建”作为自监督信号训练视觉编码器,聚焦方法创新(多视图/高掩码率/码本)与失败模式诊断。
意义:用“遮盖—重建”作为自监督信号,是目前训练视觉编码器最主流的范式之一;本主题聚焦其方法创新与失败模式诊断。
代表:Residual Connections Harm Generative Representation Learning
B. 持续 / 类增量学习
简述:解决模型在持续到来的新任务/新类上学习时遗忘旧知识(灾难性遗忘),是开放世界部署的关键,本类方法最多。
代表: Beyond Myopic Alignment: Lookahead Optimization for Online Class-Incremental Learning
C. 广义类别发现 / 新类发现
简述:在训练时标签不全(部分类有标签、部分无)的情况下,同时聚类已知类并发现新类。
意义:在"只知道部分类标签、其余类完全未知"的数据流中自动发现并归类新类,是开放世界识别的核心,多篇引入因果/类比/梯度解耦等新思想。
代表:Decouple Your Discovery and Memory in Continual Generalized Category Discovery
D. 少样本学习与少样本类增量
简述:仅用极少标注样本(或新类少量样本)完成识别/适配,含少样本类增量。
意义:用极少标注样本学会新类/新任务,并能在增量场景中持续学习;本组大量借助 CLIP/VLM 的语义先验。
代表:From Few-way to Many-way: Rethinking Few-shot Fine-grained Image Classification
E. 长尾学习
简述:处理类别样本极度不均衡(头部类多、尾部类极少)下的表征与分类。
意义:真实数据类别分布极不均衡(头类多、尾类少),如何让尾类也学得好的"头尾跷跷板"问题。
代表:Reframing Long-Tailed Learning via Loss Landscape Geometry
F. 半监督 / 域适应 / 开放世界
简述:利用大量无标注数据、跨域迁移,以及开放世界(未知类)设定提升表征。
意义:在"大量无标注 + 少量有标注""源域≠目标域""已知类≠全部类"的现实约束下做可靠学习。
代表:Measure The Feature Universe: Topology-based Pseudo Labeling and Gravity Consistency for Source-Free Domain Adaptation
G. 3D / 几何 / 点云表示学习
简述:从点云、多视图、深度、事件等几何信号学 3D/几何表征,含 3DGS、跨模态对齐。
意义:把自监督表征扩展到三维几何、点云、流形与物理系统,是机器人、AR/VR、遥感的基础能力。
代表: From Feature Learning to Spectral Basis Learning: A Unifying Framework for Shape Matching
H. 视频表示学习
简述:从视频时序/运动/多帧一致性学时空表征,含自监督视频预训练、时序建模。
意义:利用视频的时间维度(时序、运动、多帧一致性)作为自监督信号,支撑动作理解、视频生成、场景流等任务。
代表:Towards Stable Self-Supervised Object Representations in Unconstrained Egocentric Video
I. 视觉基础模型(训练 / 效率 / 分析 / 领域模型)
简述:训练/效率/分析/领域化的视觉基础模型(VFM),如开源 VFM、领域基础模型、高效训练与诊断。
意义:如何更省、更强、更可解释地造出"通用视觉底座",并把它迁移到遥感、材质、地理等垂直领域。
代表:Learning to See Through a Baby's Eyes: Early Visual Diets Enable Robust Visual Intelligence
J. 对比学习与聚类
简述:拉近正样本、推远负样本(或聚类式)的判别自监督,含码本对比等变体。
意义:通过"拉近正样本、推开负样本"学习判别性表征;本组关注多模态负样本难度、不完整多视图、细粒度与地理跨模态对齐。
代表: Nonparametric Deep Fine-grained Clustering with Low-Rank Guided Vision-Language Model
K. 层级 / 细粒度识别 /其他生成与物理信号
简述:层级表征、细粒度识别,以及基于物理/生成信号的表示。
意义:把表征扩展到"任意粒度""因果组合""物理内在分解""权重空间"等更结构化、更可解释的层面。
代表:Learning by Analogy: A Causal Framework for Compositional Generalization
L. 理论分析 / 架构诊断
简述:对 SSL 表征与架构做理论分析与失败模式诊断(残差、注意力伪影、特征几何、可塑性-稳定性等)。
意义:不再只"提方法",而是理解 SSL 表征从哪来、为什么会失败,为后续设计提供理论依据。
代表:Learning Eigenstructures of Unstructured Data Manifolds
M. 其他信号 / 测试时自监督
简述:除视觉外的模态(文本、音频、EMG 等)及测试时自适应(TTA)的自监督。
意义:把自监督表征拓展到肌电(EMG)等新信号,以及“推理阶段无标签自监督精修”的实用路线。
代表:Reading Your Actions: Learning Generalizable Action Representations via Pre-training AEMG

posted @ 2026-07-26 09:10  小周同学的CtrlCV研记  阅读(1)  评论(0)    收藏  举报