分割方向论文精读
一、趋势
① 简单介绍:
CVPR 2026 的分割方向共收录多篇相关论文,覆盖从基础模型适配、弱/无监督、视频时序、3D 与跨模态,到遥感、医学、特殊模态与评测基准的全谱系,是收录量最大的视觉子方向之一。整体呈现出「底座通用化、监督轻量化、场景极端化」三条主线。
② 基础模型成为「分割操作系统」,研究重心从造网络转向用好网络:
SAM / SAM2、CLIP、DINOv2/v3 等视觉基础模型被广泛当作通用底座,大量工作聚焦于「冻结主干 + 轻量提示/适配器/LoRA」的免训练或高效迁移;与此同时,训练-free 与免标注方案集中爆发,把部署成本压到最低。
③ 生成式反向服务分割 + 长尾极端场景成为两大新增量:
一方面,扩散 / DiT / 流匹配从「生成图像」反转为「直接生成掩码」或「合成带标训练数据」,开辟生成式分割新范式;另一方面,伪装、异常、低光、水下、事件、雷达、裂缝、X 光等极端/长尾场景成为论文最密集的增量区,体现分割研究正从「标准自然图像」走向「真实产业难题」。
二、方法
LoRA / Adapter / 提示学习(参数高效) 只训练极少量增量参数即可把大模型适配到新域/新任务,是兼顾性能与部署成本的主流微调手段。 18.5%
视频 / 时序建模 对视频序列做分割、跟踪、抠图与推理,强调时序一致性、流式/实时与运动线索利用。 14.8%
SAM / SAM2 基础模型与适配 Segment Anything 系列已成分割事实标准,大量工作围绕「冻结主干 + 轻量提示/适配器」做零样本或高效迁移,是出现频率最高的方法底座。 13.6%
弱 / 半 / 无监督 用图像级/框/点等廉价标注或完全无标注训练像素级分割,是降低标注成本、面向长尾场景的关键范式。 8.6%
扩散 / DiT / 流匹配(生成式) 从「生成图像」反转为「生成掩码」或「合成训练数据」,代表生成式反向服务分割的新兴增量;DiT 直接出掩码、流匹配替代扩散加速二分分割。 7.4%
注意力 / Transformer 架构 作为通用骨干被广泛采用,配合掩码分类、滑窗、token 合并等变体服务各类分割任务。 6.8%
三、主题
把这 多论文按其「主要贡献」归入 15 个主题。每一类有各自不同的落地场景。
A. 开放词汇与免训练分割
简述: 让模型不依赖像素级标注、直接用文本提示分割任意类别;免训练方案成为主流以降低部署成本。
应用场景: 开放词汇零样本分割、检索、机器人/具身感知中「指任何东西都能分」的场景。
意义: 打破封闭词表限制,是通用分割/多模态交互的基础能力,直接服务机器人、AR 与开放世界感知。
代表论文:The Power of Prior: Training-Free Open-Vocabulary Semantic Segmentation with LLaVA
B. 弱/半/无监督分割
简述: 用图像级/框/点等弱标注或完全无标注训练像素级分割,重点是更聪明地利用监督信号与未标数据。
应用场景: 标注昂贵或不可得的场景:医学影像、工业缺陷、长尾类别、动作时序切分。
意义: 把分割从「重标注」解放出来,决定了算法能否在真实长尾、稀缺标注场景落地。
代表论文:From Softmax to Dirichlet: Evidential Learning for Semi-supervised Semantic Segmentation
C. 视频与指代分割
简述: 在视频序列上做实例/语义/指代/抠图/推理分割,强调时序一致性、流式实时与运动线索。
应用场景: 视频理解、内容检索、自动驾驶、具身智能中需要「分割+跟踪+描述」联动的场景。
意义: 视频是真实世界的主要载体,视频分割质量直接决定后续理解、检索与决策的上限。
代表论文:CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects
D. 伪装/异常/显著目标检测
简述: 针对「外观与背景高度相似」或「异常/显著」目标,引入几何、频率、多模态线索破解难分问题。
应用场景: 工业瑕疵/缺陷检测、生物医学(息肉、病变)、生态监测、安防(伪装人员/物体)。
意义: 这类目标是传统分割的盲区,关系工业质检良率、医疗早筛与国家安全等高风险场景。
代表论文:Beyond Appearance: Camouflaged Object Detection via Geometric Structure
E. 域适应与域泛化
简述: 处理训练/测试分布偏移,分无源域适应(UDA)、域泛化(DG)、测试时适应(TTA)等子方向。
应用场景: 跨域部署:合成数据→真实、昼→夜/雨雾、源域数据不可得(隐私/保密)的迁移。
意义: 模型能否在没见过的环境里仍work,决定其在真实世界能否被信任地部署。
代表论文:GeCo: Geometry-Consistent Regularization for Domain Generalized Semantic Segmentation
F. 3D 与跨模态分割
简述: 面向 3D 点云/高斯场景的语义、实例、指代与功能(affordance)分割,及 2D→3D 知识迁移。
应用场景: 三维重建/编辑、机器人抓取、AR/VR、自动驾驶场景理解、数字孪生。
意义: 从「看」到「懂三维世界」是机器人与具身智能的核心能力跃迁。
代表论文: B³-Seg: Camera-Free, Training-Free 3DGS Segmentation via Analytic EIG and Beta-Bernoulli Bayesian Updates
G. 遥感/雷达/高光谱分割
简述: 面向多光谱/高光谱/SAR/雷达等遥感模态的语义与显著分割,强调超高分辨率与模态缺失鲁棒性。
应用场景: 国土监测、农业估产、灾害评估、城市规划、SAR/高光谱军事与环保遥感。
意义: 遥感分割是数字政府、粮食安全与应急响应的基础设施级能力。
代表论文:SARMAE: Masked Autoencoder for SAR Representation Learning
H. 医学/显微/X光分割
简述: 医学/显微/X 光场景的分割,常面临标注稀缺、模态特殊、对精度与可解释性要求高。
应用场景: 医疗影像诊断(息肉/病变/亚细胞)、电镜三维重构、安检 X 光违禁品识别。
意义: 直接服务于临床早筛、科研与公共安全,是高价值垂直落地方向。
代表论文:XSeg: A Large-scale X-ray Contraband Segmentation Benchmark for Real-World Security Screening
I. 扩散与生成式分割
简述: 用扩散/DiT/流匹配等生成模型「直接生成掩码」或「合成带标训练数据」,是生成式反向服务分割的新增量。
应用场景: 数据合成(缓解长尾/稀缺标注)、生成式分割、图像编辑/分层、二分高精度分割。
意义: 把生成模型的强表征「反哺」分割,既补数据又开新分割范式,是近年最热的方法分支之一。
代表论文: GenMask: Adapting DiT for Segmentation via Direct Mask Generation
J. 多模态/推理/对话式分割
简述: 按复杂语言(属性/关系/推理/抽象概念)或多轮对话做分割,强调语言与像素的精细对齐。
应用场景: 自然人机对话交互、视觉语言定位(VLG)、机器人抓取指令理解、推理/抽象概念接地。
意义: 是从「点选分割」走向「说一句话就能分」的关键,直接决定多模态助手与机器人的可用性。
代表论文:Conversational Image Segmentation: Grounding Abstract Concepts with Scalable Supervision
K. 提示学习/SAM/基础模型
简述: 围绕视觉基础模型的提示学习、LoRA/Adapter 适配、知识蒸馏与多 VFM 特征融合。
应用场景: 基础模型(SAM/CLIP/DINO)的高效适配、轻量部署、提示学习与多基础模型融合。
意义: 基础模型是「分割操作系统」,如何低成本用好它,是当前研究的工程主轴。
代表论文: GKD: Generalizable Knowledge Distillation from Vision Foundation Models for Semantic Segmentation
L. 小样本与跨域少样本
简述: 仅用极少标注(几张支持集)或跨域少样本完成语义/实例分割,强调原型与贝叶斯框架。
应用场景: 标注极少的新类/新域(如罕见病种、跨域工业件)快速适配。
意义: 决定模型面对「没见过的少数样本」能否快速学会,是少样本落地与持续学习的核心。
代表论文: Bayesian Decomposition and Semantic Completion for Few-shot Semantic Segmentation
M. 高效/轻量/实时分割
简述: 用 token 合并、纯编码器、端云协同、精简 MAE 等办法降低计算,换实时与轻量。
应用场景: 实时/边缘部署:移动端、机器人机载、自动驾驶在线分割、视频实时推理。
意义: 效率是算法能否上设备的硬约束,是「论文→产品」的隐形刚需。
代表论文:MPM: Mutual Pair Merging for Efficient Vision Transformers
N. 特殊模态与场景分割
简述: 面向非自然 RGB 的特殊模态与场景,强调定制算子、模态缺失鲁棒与物理线索利用。
应用场景: 特殊成像与极端环境:热成像、水下、事件相机、雷达、RGB-D、裂缝/建筑缺陷、CAD、地理定位、音视。
意义: 这些「长尾极端场景」是产业真问题(基建、安防、水下、夜间),也是论文增量最集中处。
代表论文:CrackSSM: Reviving SSMs for Crack Segmentation via Dynamic Scanning
O. 评测基准与通用框架
简述: 评测基准、标注者一致性(IAA)元算法、超像素等「地基」工作,服务整个方向的方法比较与数据治理。
应用场景: 数据集质量评估、标注一致性把控、通用分割框架/超像素等基础设施。
意义: 基础设施决定了研究方向是否健康——好的基准与一致性度量能避免方法「刷分」虚高。
代表论文: Kαlos finds Consensus: A Meta-Algorithm for Evaluating Inter-Annotator Agreement in Complex Vision Tasks

浙公网安备 33010602011771号