从 CLIP 到通用视觉感知底座:Text–Image Pretraining 的范式演进与 2026 年最新进展
从 CLIP 到通用视觉感知底座:Text–Image Pretraining 的范式演进与 2026 年最新进展
过去几年,多模态模型的发展速度非常快。
从 CLIP 开始,研究者第一次证明:不依赖固定类别标签,只需要利用互联网上的大规模图像—文本对,就可以训练出具备开放词汇识别、跨模态检索和零样本迁移能力的视觉模型。
随后,BLIP、CoCa、SigLIP、BLIP-2、AIMv2、SigLIP 2、Perception Encoder、FG-CLIP 2 和 TIPSv2 等模型不断扩展这一范式。Text–Image Pretraining 也逐渐从“图像与文本的全局对齐”,演变为同时学习:
- 全局语义;
- 局部区域;
- 空间结构;
- 细粒度属性;
- 多语言知识;
- 长文本描述;
- 图像与视频动态信息;
- 面向多模态大模型的视觉 Token。
截至 2026 年,Text–Image Pretraining 已不再只是一个图文检索技术,而正在成为多模态大模型、开放词汇视觉系统、视觉 Agent、机器人和世界模型的重要感知基础设施。
本文将系统梳理 Text–Image Pretraining 的技术演进、最新模型、数据工程、评测方法和未来研究方向。
一、什么是 Text–Image Pretraining?
Text–Image Pretraining,通常可以翻译为“图像—文本预训练”或“语言—图像预训练”,其核心目标是:
利用自然语言作为监督信号,使视觉模型学习能够被语言描述、检索和组合的视觉表示。
传统视觉分类模型通常学习:
其中 (x) 是图像,(y) 是一个预先定义好的类别,例如猫、狗、汽车。
这种训练方式存在一个明显限制:模型只能识别训练标签空间中的类别。当新增一个概念时,通常需要重新收集标注数据并训练分类器。
Text–Image Pretraining 则学习:
其中:
- (\(f_\theta\)) 是图像编码器;
- (\(g_\phi\)) 是文本编码器;
- (x) 是图像;
- (t) 是与图像相关的自然语言描述。
模型不再直接预测固定类别,而是将图像和文本映射到一个共享语义空间。推理时,只需要输入不同的文本描述,就可以动态构造新的分类器或检索查询。
CLIP 使用约 4 亿个互联网图文对训练图像编码器和文本编码器,证明了这种自然语言监督可以迁移到分类、OCR、动作识别、细粒度识别和地理定位等大量视觉任务。ALIGN 则进一步表明,即使网页 alt-text 数据包含大量噪声,十亿级训练规模仍然能够产生较强的视觉—语言表示。
二、CLIP 为什么具有里程碑意义?
CLIP 的结构并不复杂,它由两个独立编码器组成:
图像和文本特征经过归一化后,计算一个 batch 内所有图文组合的相似度:
其中 ($$\tau$$) 是温度参数。
训练目标要求真实图文对的相似度更高,错误组合的相似度更低。这类方法通常被称为双编码器或者 Dual Encoder。
双编码器的工程优势非常明显:
- 图像和文本可以分别编码;
- 图像特征可以预计算并写入向量数据库;
- 检索阶段只需要计算向量相似度;
- 文本可以动态定义类别和概念;
- 同一个视觉编码器可以迁移到多个任务。
因此,CLIP 很快成为开放词汇分类、图文检索、图像生成评估、开放词汇检测以及多模态大模型视觉编码器的重要基础。
但 CLIP 的强大,也掩盖了它的结构性缺陷。
它主要优化的是整图和整句之间的全局相似度。只要模型能够识别一张图像中出现了“人”“马”“红色”“草地”等关键词,即使没有真正理解“谁骑着谁”“红色属于哪个对象”,也可能在传统检索数据集上得到较高分数。
ARO 等组合性评测表明,早期视觉—语言模型在属性绑定、对象关系和文本顺序敏感性方面存在明显不足,经常表现得更接近“视觉词袋模型”。
三、Text–Image Pretraining 的三次范式迁移
3.1 第一阶段:全局图文对齐
这一阶段的代表模型包括:
- CLIP;
- ALIGN;
- OpenCLIP;
- MetaCLIP;
- SigLIP。
核心任务是整图和整句的全局对齐。
CLIP 使用 batch 内 softmax 对比损失,需要比较一个 batch 中所有图文组合。SigLIP 则将其替换为独立图文 pair 的 sigmoid 二分类损失,不再依赖跨设备的全局 softmax 归一化,因此能够在较小 batch 下获得更好的训练效果,也更适合大规模分布式训练。
这一阶段解决了视觉模型的开放词汇问题,但重点仍然是:
它并没有真正解决局部空间、对象关系和细粒度视觉理解。
3.2 第二阶段:对比学习与生成学习融合
研究者很快发现,仅靠对比学习,文本给视觉模型提供的监督仍然过于粗糙。
一段图像描述可能包含多个对象、属性和关系,但对比损失通常只产生一个全局匹配信号。为了获得更密集的监督,CoCa 同时使用图文对比损失和 captioning 损失,让模型既能够学习共享 embedding,也能够根据图像生成文本。
其训练目标可以概括为:
BLIP 则从数据工程角度引入 caption bootstrapping:
- 使用 captioner 为图像生成更丰富的描述;
- 使用过滤器删除低质量图文对;
- 同时支持理解任务和生成任务。
BLIP-2 进一步提出 Q-Former,以一个轻量 Querying Transformer 连接冻结的视觉编码器和冻结的语言模型,大幅降低了视觉—语言联合训练的参数和计算成本。
从这一阶段开始,Text–Image Pretraining 与多模态大模型的界限开始变得模糊。
3.3 第三阶段:通用视觉感知预训练
2025 年之后,研究目标再次发生变化。
领先模型不再只追求 ImageNet 零样本分类和 COCO 图文检索,而是开始系统优化:
- 定位;
- 分割;
- 深度估计;
- OCR;
- 文档理解;
- 长文本;
- 多语言;
- 原始宽高比;
- 图像和视频统一;
- 多模态大模型视觉 Token 质量。
这一阶段的目标已经不只是学习一个图文相似度空间,而是训练一个通用视觉感知底座。
一个更完整的训练目标可以写成:
其中:
- ($$\mathcal{L}_{\mathrm{global}}$$) 负责整图—整句对齐;
- ($$\mathcal{L}_{\mathrm{local}}$$) 负责区域—短语或 Patch—文本对齐;
- ($$\mathcal{L}_{\mathrm{caption}}$$) 提供细节和关系监督;
- ($$\mathcal{L}_{\mathrm{self\text{-}supervised}}$$) 保留低层视觉结构;
- ($$\mathcal{L}_{\mathrm{relation}}$$) 学习对象之间的组合关系。
四、2025—2026 年值得关注的模型
4.1 SigLIP 2:从强图文编码器走向通用视觉编码器
SigLIP 2 是当前最具代表性的开放视觉—语言编码器之一。
它没有简单地继续扩大模型,而是在原有 sigmoid 图文对齐目标上整合了:
- captioning-based pretraining;
- self-distillation;
- masked prediction;
- online data curation;
- 多语言数据;
- 去偏数据配比;
- 多分辨率和原始宽高比训练。
SigLIP 2 发布了 ViT-B、ViT-L、So400m 和 ViT-g 等多个规模。相较原始 SigLIP,它不仅在零样本分类和图文检索上有所改善,在定位、密集预测以及作为 VLM 视觉编码器时也表现出更强的迁移能力。
SigLIP 2 最重要的启示并不是 sigmoid loss 本身,而是:
一个通用视觉编码器需要同时接受语言监督和视觉自监督,不能让所有视觉信息都被压缩成文本能够直接描述的全局语义。
SigLIP 2 的 NaFlex 版本还允许保留输入图像的原始宽高比。这对于文档、网页截图、OCR、遥感图像和长图尤其重要,因为强制裁剪为正方形可能破坏文字布局和空间结构。
4.2 Perception Encoder:最好的视觉特征可能不在最后一层
Meta 在 2025 年发布的 Perception Encoder 提出了一个非常值得重视的结论:
最适合通用视觉任务的特征,往往隐藏在视觉网络的中间层,而不是最后一层。
在 CLIP 式训练中,网络最后几层会不断将视觉特征压缩到与文本 embedding 对齐的空间。这个过程有利于图文检索和语义分类,却可能损失:
- 空间布局;
- 几何结构;
- 深度信息;
- 边缘和纹理;
- 小目标细节。
Perception Encoder 因此设计了两类对齐方法:
- Language Alignment:提取适合多模态语言模型的特征;
- Spatial Alignment:提取适合检测、深度、分割和跟踪的特征。
该模型在图像和视频分类、检索、文档问答、视频问答、检测、深度估计和跟踪等任务上进行了统一评估。
这一发现对多模态大模型架构有直接影响。
传统架构通常只取视觉编码器的最后一层:
未来更合理的做法可能是使用多层特征:
其中:
- ($$F_l$$) 是第 (l) 层视觉特征;
- ($$P_l$$) 是层间投影器;
- ($$\alpha_l(x,q)$$) 根据图像和问题动态分配权重。
例如,分类问题可以更多使用后层语义特征,OCR、定位和深度问题则可以更多使用中间层空间特征。
4.3 AIMv2:用自回归生成训练视觉编码器
AIMv2 代表了另一条重要路线:不再只通过图文匹配训练视觉编码器,而是让模型自回归预测图像 Patch 和文本 Token。
其基本结构包含:
- 一个视觉编码器;
- 一个多模态自回归解码器;
- 图像 Patch 预测;
- 文本 Token 预测。
训练目标可以简化为:
与 CLIP 每个图文对主要提供一个全局匹配信号不同,AIMv2 可以从每个视觉 Patch 和文本 Token 中获得监督,因此更有机会保留细粒度视觉内容。
论文报告 AIMv2-3B 在冻结视觉主干的 ImageNet-1K 评估中达到 89.5%,并在定位、grounding、分类和多模态图像理解任务上展示出较强能力。
这条路线的核心判断是:
一个优秀的多模态大模型视觉编码器,不仅应该知道“这张图和哪句话匹配”,还应该包含足够的信息来解释甚至重建图像内容。
不过,AIMv2 更偏向通用视觉理解和多模态生成,并不必然是大规模图文向量检索中最经济的方案。
4.4 MetaCLIP 2:从英文互联网扩展到全球互联网
早期 CLIP 数据和 benchmark 明显偏向英文及西方互联网内容。
MetaCLIP 2 试图解决两个问题:
- 如何从多语言全球网页中收集和整理图文数据;
- 如何避免多语言训练导致英文能力下降,即所谓的 multilinguality curse。
MetaCLIP 2 通过全球化 metadata 构建、语言平衡和数据分布控制,让英文和非英文数据产生互补,而不是简单竞争训练容量。论文报告其 ViT-H/14 在英文 ImageNet 零样本分类以及 CVQA、Babel-ImageNet、XM3600 等多语言评测上取得了较强结果。
它说明多语言视觉—语言学习并不是“把 caption 翻译成更多语言”那么简单,而是一个涉及以下问题的数据工程系统:
- 不同语言的数据比例;
- 不同文化概念的覆盖率;
- 长尾实体采样;
- 语言质量差异;
- 同一视觉概念在不同语言中的表达差异。
4.5 FG-CLIP 与 FG-CLIP 2:细粒度与中英双语对齐
CLIP 使用的大量网页文本往往很短,例如:
A dog in a park.
但真正的细粒度视觉理解可能需要:
A small brown dog wearing a red collar is running behind a yellow ball on the left side of a grassy park.
两者提供的监督密度完全不同。
FG-CLIP 通过三类数据增强细粒度能力:
- 16 亿长描述图文对;
- 1200 万图像和约 4000 万区域框—文本标注;
- 1000 万细粒度 hard negative。
这些数据用于强化对象属性、局部区域、视觉关系和近义描述之间的区分。
FG-CLIP 2 则将这一方向扩展到中英双语,加入:
- region-text matching;
- long-caption modeling;
- 多种判别式目标;
- Textual Intra-modal Contrastive loss;
- 中文长文本和区域级数据;
- 中英文共享视觉语义空间。
FG-CLIP 2 在 29 个数据集和 8 类任务上进行了评估,目标包括中英文检索、细粒度分类、区域理解和开放词汇视觉任务。
对于中文电商、工业视觉、商品检索、内容审核和中文多模态大模型,这条路线尤其值得关注。
4.6 TIPSv2:从整图—文本对齐推进到 Patch—文本对齐
TIPSv2 聚焦一个长期存在却容易被忽略的问题:
模型的全局图文 embedding 很强,并不意味着单个视觉 Patch 能够与对应文本概念准确对齐。
例如一张包含汽车、行人、路牌和红绿灯的图片,CLIP 可能知道整张图属于“城市道路”,但未必能够让每一个 Patch 分别对应汽车、行人和红绿灯。
TIPSv2 使用 patch-level distillation 和改进的 iBOT 式视觉自监督训练,提高视觉 Patch 与文本概念的密集对齐能力。论文观察到,经过 Patch 级蒸馏后,学生模型的 Patch—文本对齐甚至能够超过教师模型。
TIPSv2 可以直接利用 Patch 和类别文本之间的相似度进行零样本分割,而不依赖额外的复杂后处理。
这一方向对于以下任务非常关键:
- 开放词汇语义分割;
- referring expression grounding;
- 区域级检索;
- 密集视觉 Token;
- 机器人目标定位;
- 多模态大模型局部证据提取。
4.7 MobileCLIP 2:端侧模型的竞争转向数据蒸馏
MobileCLIP 2 关注低延迟和端侧部署。
它延续 Multi-Modal Reinforced Training,通过多个教师模型和 caption generator 为小模型提供更丰富的训练信号。其关键改进包括:
- 更强的 CLIP teacher ensemble;
- 更丰富的合成 caption;
- 多 caption generator 联合蒸馏;
- 对比蒸馏温度参数调优;
- 针对低延迟架构的训练优化。
MobileCLIP 系列面向约 50M 到 150M 参数及毫秒级推理场景。MobileCLIP 2 的实验说明,在小模型场景下,teacher 质量、caption 多样性和蒸馏 recipe 往往比继续修改轻量网络结构更重要。
4.8 TuringViT:动态分辨率与线性注意力
TuringViT 是 2026 年发布的一项视觉编码器工作,主要尝试降低高分辨率和动态分辨率预训练的成本。
其设计包括:
- Turing Linear Attention;
- 动态分辨率预训练;
- 原始宽高比图像输入;
- 图像—视频数据整理;
- 面向 VLM 的统一视觉训练流程。
论文中的主要模型使用约 8.5 亿图文对训练,并在图像分类、图文检索、密集预测、视频迁移和下游 VLM 上进行了评估。
它反映了一个越来越明确的趋势:
视觉编码器不能继续假设所有输入都是固定的 (224\times224) 或 (384\times384) 正方形图像。
在文档、网页、遥感、工业质检和视频场景中,视觉编码器需要原生支持:
- 不同宽高比;
- 不同 Token 数量;
- 不同空间分辨率;
- 不同时间长度;
- 动态计算预算。
4.9 LIFT 与 CLIMP:两条值得跟踪的探索路线
LIFT 提出,不一定需要同时训练图像编码器和文本编码器。它固定一个预训练 LLM 的文本编码空间,只训练视觉编码器与其对齐。论文报告,这种方法在长文本和组合性理解任务上能够超过其 CLIP 对照,同时降低联合训练成本。
CLIMP 则使用 Mamba 同时替代视觉和文本 Transformer 编码器,探索状态空间模型在图文对比预训练中的可行性。其目标包括:
- 降低高分辨率计算复杂度;
- 支持可变分辨率;
- 改善长文本编码;
- 提高部分分布外任务的鲁棒性。
论文报告 CLIMP 在 ImageNet-O 和超高分辨率检索实验中表现出一定优势,但这一方向仍需要更大规模训练和独立复现。
五、真正决定模型上限的,正在从架构转向数据
5.1 数据规模并不等于有效监督规模
CLIP 时代最直观的扩展方式是增加图文对数量。
但不同图文对提供的训练价值差异很大:
- 图片与文本是否真正对应;
- 文本是否描述视觉内容;
- 文本是否包含细粒度信息;
- 是否覆盖长尾概念;
- 是否存在重复数据;
- 是否包含有害偏差;
- 是否覆盖非英文文化内容。
Data Filtering Networks 的研究表明,最适合做数据过滤的模型,并不一定是下游 ImageNet 准确率最高的模型。DFN-5B 所筛选的数据使 ViT-H 在论文实验中达到 84.4% 的 ImageNet 零样本准确率,并超过多个其他大规模数据集训练的对照模型。
这说明数据筛选器本身也需要专门设计和训练。
5.2 100B 数据实验:传统 benchmark 饱和,不代表数据扩展无效
2025 年的一项研究将视觉—语言预训练规模扩展到 1000 亿样本。
研究发现:
- COCO 等传统、西方中心化的分类和检索 benchmark 逐渐饱和;
- 文化多样性、长尾概念和低资源语言仍然持续受益;
- 过强的 CLIP similarity filtering 可能删除非西方和文化长尾数据。
因此,“扩大数据已经没有价值”是一个错误结论。
更准确的判断是:
传统 benchmark 对数据覆盖率增长已经不够敏感,而真实世界多样性仍然需要更大规模、更广覆盖的数据。
5.3 Synthetic Caption 已成为标准组件
网页 alt-text 经常包含文件名、SEO 文本、无关描述或极短标签,因此越来越多模型使用多模态大模型生成合成 caption。
Synthetic Caption 可以补充:
- 对象属性;
- 空间位置;
- 对象关系;
- 背景环境;
- OCR 内容;
- 细粒度动作;
- 视觉风格。
但 caption 并不是越长越好。
过长描述可能包含:
- 模型幻觉;
- 不可见知识;
- 重复信息;
- 与图像无关的推断;
- 大量容易学习但没有视觉价值的语言模式。
因此,当前更合理的方法是混合使用:
- 原始 alt-text;
- 简短 caption;
- 长 caption;
- 区域 caption;
- OCR 文本;
- 结构化对象—属性—关系描述;
- hard negative caption。
模型需要学习多种描述粒度,而不是只依赖一种“超长描述”。
5.4 从 Data Filtering 转向 Data Mixing
到了生成式 VLM 阶段,问题已经不再只是哪些图文对应该保留,而是不同类型的数据应该如何组合。
DataComp-VLM 汇总了 160 个数据集,覆盖:
- image-caption pairs;
- multimodal interleaved documents;
- text-only data;
- instruction-tuning data;
总规模约为 6T 多模态 Token,并支持在 1B 至 8B 模型、6.25B 至 200B Token 预算下进行受控实验。
其研究发现,在 VLM 训练中,data mixing 比单纯 filtering 更关键;随着模型和训练规模增长,instruction-heavy mixture 相比 caption-heavy mixture 的优势会进一步扩大。
这意味着 CLIP 时代的最佳数据策略,不能直接迁移到多模态大模型。
未来更重要的问题是:$$[ p_k(t)$$
这一方向在电商搜索、工业视觉、广告审核、商品理解、中文文档和本地生活内容中具有很高的应用价值。
七、评测体系也必须发生变化
过去判断一个 Text–Image 模型是否优秀,通常只看:
- ImageNet zero-shot accuracy;
- COCO Retrieval Recall@K;
- Flickr30K Retrieval;
- 少量线性探测任务。
这些指标已经不足以判断视觉编码器是否适合作为通用感知底座。
AVA-Bench 将视觉能力拆分为 14 类原子能力,包括定位、深度和空间理解等,从而为不同视觉基础模型建立“能力指纹”。它还发现,使用较小语言模型作为统一评测头,也可以获得与更大语言模型相近的视觉编码器排名,从而显著降低评测成本。
未来视觉编码器至少应该从以下维度评估:
| 能力维度 | 代表任务 |
|---|---|
| 全局语义 | 零样本分类、图文检索 |
| 细粒度语义 | 属性识别、商品识别、物种识别 |
| 组合理解 | 属性绑定、对象关系、顺序和否定 |
| 空间感知 | 定位、深度、方向、计数 |
| 密集感知 | 分割、检测、Patch 检索 |
| 文字感知 | OCR、文档、图表、网页 |
| 多语言 | 跨语言检索、文化实体理解 |
| 鲁棒性 | OOD、遮挡、低分辨率、域迁移 |
| 视频能力 | 动作、时序、视频检索 |
| VLM 迁移 | 作为 MLLM 视觉编码器的表现 |
| 部署效率 | 延迟、显存、吞吐、Token 数量 |
“哪个视觉编码器最好”并不存在一个单一答案。
DINO 式视觉自监督模型可能更擅长空间和几何信息,CLIP/SigLIP 式语言监督模型可能更擅长开放语义和 OCR,而 AIMv2、SigLIP 2 和 Perception Encoder 等混合路线则试图在两者之间取得平衡。
八、实际项目中应该如何选择模型?
8.1 通用分类与图文检索
优先考虑:
- SigLIP 2;
- MetaCLIP 2;
- FG-CLIP 2;
- MobileCLIP 2。
如果强调多语言,可以优先比较 MetaCLIP 2 和 SigLIP 2;如果强调中文和细粒度检索,则应重点评估 FG-CLIP 2。
8.2 多模态大模型视觉编码器
优先考虑:
- SigLIP 2;
- Perception Encoder;
- AIMv2;
- TuringViT。
但模型选择不能只比较冻结编码器的 ImageNet 准确率。
更合理的受控实验应该固定:
- 相同 LLM;
- 相同 projector;
- 相同训练数据;
- 相同视觉 Token 数;
- 相同输入分辨率;
- 相同训练步数。
否则最终差异可能来自 Token 数量、数据配比或连接器,而不是视觉编码器本身。
8.3 开放词汇检测、分割和 Grounding
优先关注:
- TIPSv2;
- FG-CLIP 2;
- Perception Encoder Spatial;
- SigLIP 2。
这类任务应重点评估 Patch 和 Region 特征,而不是只使用全局 CLS Token。
8.4 文档、网页和 OCR
需要优先关注:
- 原始宽高比;
- 动态分辨率;
- 高分辨率 Token 效率;
- 小文字保留能力;
- 中间层空间特征。
SigLIP 2 NaFlex、FG-CLIP 2、TuringViT 以及面向文档定制的视觉编码器,都比固定正方形低分辨率 CLIP 更适合作为起点。
8.5 移动端和实时应用
优先考虑:
- MobileCLIP 2;
- 较小规模 SigLIP 2;
- 经过蒸馏的领域模型。
在端侧场景中,模型参数量不是唯一指标,还需要实际测试:
- 图像预处理时间;
- 编码延迟;
- 内存峰值;
- 向量维度;
- 批处理吞吐;
- 不同硬件后端的算子支持。
九、未来值得研究的五个方向
9.1 Layer-Adaptive Visual Token
视觉编码器不再只提供最后一层,而是让系统根据任务动态选择不同层级。
这是连接全局语义、局部空间和动态计算的一个重要方向。
9.2 Global–Local–Relational 三层对齐
未来的视觉—语言预训练应该同时建立:
- 整图—整句对齐;
- 区域—短语对齐;
- 对象关系—语言关系对齐。
可以使用统一目标:
单纯增加 caption 长度,并不能保证模型真正学会属性绑定和关系推理。
9.3 Objective Curriculum
与其从训练第一步开始固定叠加所有损失,更合理的方法可能是分阶段学习:
- 视觉自监督初始化;
- 全局图文对齐;
- caption generation;
- Patch/Region 对齐;
- 组合性 hard negatives;
- 与目标 LLM 的深度对齐。
不同阶段优化不同能力,可以减少多目标之间的梯度冲突。
9.4 Task-Aware Dynamic Resolution
未来模型可以根据图像类型和用户问题选择分辨率。
例如:
- 普通场景分类使用较低分辨率;
- OCR 和文档使用高分辨率;
- Grounding 使用局部裁剪;
- 视频任务动态分配时间和空间 Token;
- 简单问题减少视觉 Token;
- 复杂问题保留更多局部证据。
其目标可以写成:
其中 (\(\pi(x,q)\)) 是视觉编码策略,(B) 是 Token 或计算预算。
9.5 从 Image–Text 走向 Image–Video–Text–Action
Text–Image Pretraining 的下一阶段,很可能不再局限于静态图像。
未来的预训练数据会逐渐包含:
- 图像;
- 视频;
- 音频;
- 文本;
- 动作;
- 状态转移;
- 交互轨迹。
静态图文对齐学习的是:
而具身智能和世界模型需要进一步学习:
因此,Text–Image Pretraining 很可能成为更广义的视觉—语言—动作预训练的基础阶段,而不是终点。
十、结语
回顾过去五年,Text–Image Pretraining 的演进路径非常清晰:
- CLIP 证明了自然语言可以替代固定类别标签;
- ALIGN 证明了数据规模能够部分抵消网页噪声;
- SigLIP 改进了大规模图文对齐目标;
- CoCa 和 BLIP 将对比学习与生成学习结合;
- BLIP-2 建立了视觉编码器与大语言模型之间的高效桥梁;
- AIMv2 探索了生成式视觉编码器;
- SigLIP 2 将对比、生成、自监督、多语言和动态分辨率整合为统一 recipe;
- Perception Encoder 揭示了中间层视觉表示的价值;
- FG-CLIP 2 推进了中英双语与细粒度区域对齐;
- TIPSv2 将竞争焦点推进到 Patch—Text Alignment;
- DataComp-VLM 则进一步表明,数据配比正在超越单纯的数据过滤,成为决定 VLM 能力的重要变量。
因此,未来真正有竞争力的视觉编码器,不会只是一个“更大的 CLIP”。
它需要同时具备:
- 语言可解释的全局语义;
- 可定位的局部视觉证据;
- 可组合的对象关系;
- 可扩展的多语言空间;
- 可适配的分辨率和 Token 预算;
- 可迁移到图像、视频、文档、Agent 和机器人系统的统一表示。
Text–Image Pretraining 正在从“对齐两种模态”,转向“构建机器理解视觉世界的通用表示”。
而这场变化,才刚刚开始。

浙公网安备 33010602011771号