AIGC标识 从 CLIP 到通用视觉感知底座:Text–Image Pretraining 的范式演进与 2026 年最新进展

从 CLIP 到通用视觉感知底座:Text–Image Pretraining 的范式演进与 2026 年最新进展

过去几年,多模态模型的发展速度非常快。

从 CLIP 开始,研究者第一次证明:不依赖固定类别标签,只需要利用互联网上的大规模图像—文本对,就可以训练出具备开放词汇识别、跨模态检索和零样本迁移能力的视觉模型。

随后,BLIP、CoCa、SigLIP、BLIP-2、AIMv2、SigLIP 2、Perception Encoder、FG-CLIP 2 和 TIPSv2 等模型不断扩展这一范式。Text–Image Pretraining 也逐渐从“图像与文本的全局对齐”,演变为同时学习:

  • 全局语义;
  • 局部区域;
  • 空间结构;
  • 细粒度属性;
  • 多语言知识;
  • 长文本描述;
  • 图像与视频动态信息;
  • 面向多模态大模型的视觉 Token。

截至 2026 年,Text–Image Pretraining 已不再只是一个图文检索技术,而正在成为多模态大模型、开放词汇视觉系统、视觉 Agent、机器人和世界模型的重要感知基础设施。

本文将系统梳理 Text–Image Pretraining 的技术演进、最新模型、数据工程、评测方法和未来研究方向。


一、什么是 Text–Image Pretraining?

Text–Image Pretraining,通常可以翻译为“图像—文本预训练”或“语言—图像预训练”,其核心目标是:

利用自然语言作为监督信号,使视觉模型学习能够被语言描述、检索和组合的视觉表示。

传统视觉分类模型通常学习:

\[[ x \rightarrow y, ]\]

其中 (x) 是图像,(y) 是一个预先定义好的类别,例如猫、狗、汽车。

这种训练方式存在一个明显限制:模型只能识别训练标签空间中的类别。当新增一个概念时,通常需要重新收集标注数据并训练分类器。

Text–Image Pretraining 则学习:

\[[ f_\theta(x) \approx g_\phi(t), ]\]

其中:

  • (\(f_\theta\)) 是图像编码器;
  • (\(g_\phi\)) 是文本编码器;
  • (x) 是图像;
  • (t) 是与图像相关的自然语言描述。

模型不再直接预测固定类别,而是将图像和文本映射到一个共享语义空间。推理时,只需要输入不同的文本描述,就可以动态构造新的分类器或检索查询。

CLIP 使用约 4 亿个互联网图文对训练图像编码器和文本编码器,证明了这种自然语言监督可以迁移到分类、OCR、动作识别、细粒度识别和地理定位等大量视觉任务。ALIGN 则进一步表明,即使网页 alt-text 数据包含大量噪声,十亿级训练规模仍然能够产生较强的视觉—语言表示。


二、CLIP 为什么具有里程碑意义?

CLIP 的结构并不复杂,它由两个独立编码器组成:

\[[ v_i=f_\theta(x_i), \qquad u_j=g_\phi(t_j). ]\]

图像和文本特征经过归一化后,计算一个 batch 内所有图文组合的相似度:

\[[ s_{ij}=\frac{v_i^\top u_j}{\tau}, ]\]

其中 ($$\tau$$) 是温度参数。

训练目标要求真实图文对的相似度更高,错误组合的相似度更低。这类方法通常被称为双编码器或者 Dual Encoder。

双编码器的工程优势非常明显:

  1. 图像和文本可以分别编码;
  2. 图像特征可以预计算并写入向量数据库;
  3. 检索阶段只需要计算向量相似度;
  4. 文本可以动态定义类别和概念;
  5. 同一个视觉编码器可以迁移到多个任务。

因此,CLIP 很快成为开放词汇分类、图文检索、图像生成评估、开放词汇检测以及多模态大模型视觉编码器的重要基础。

但 CLIP 的强大,也掩盖了它的结构性缺陷。

它主要优化的是整图和整句之间的全局相似度。只要模型能够识别一张图像中出现了“人”“马”“红色”“草地”等关键词,即使没有真正理解“谁骑着谁”“红色属于哪个对象”,也可能在传统检索数据集上得到较高分数。

ARO 等组合性评测表明,早期视觉—语言模型在属性绑定、对象关系和文本顺序敏感性方面存在明显不足,经常表现得更接近“视觉词袋模型”。


三、Text–Image Pretraining 的三次范式迁移

3.1 第一阶段:全局图文对齐

这一阶段的代表模型包括:

  • CLIP;
  • ALIGN;
  • OpenCLIP;
  • MetaCLIP;
  • SigLIP。

核心任务是整图和整句的全局对齐。

CLIP 使用 batch 内 softmax 对比损失,需要比较一个 batch 中所有图文组合。SigLIP 则将其替换为独立图文 pair 的 sigmoid 二分类损失,不再依赖跨设备的全局 softmax 归一化,因此能够在较小 batch 下获得更好的训练效果,也更适合大规模分布式训练。

这一阶段解决了视觉模型的开放词汇问题,但重点仍然是:

\[[ \text{Image-level semantics} \leftrightarrow \text{Sentence-level semantics}. ]\]

它并没有真正解决局部空间、对象关系和细粒度视觉理解。


3.2 第二阶段:对比学习与生成学习融合

研究者很快发现,仅靠对比学习,文本给视觉模型提供的监督仍然过于粗糙。

一段图像描述可能包含多个对象、属性和关系,但对比损失通常只产生一个全局匹配信号。为了获得更密集的监督,CoCa 同时使用图文对比损失和 captioning 损失,让模型既能够学习共享 embedding,也能够根据图像生成文本。

其训练目标可以概括为:

\[[ \mathcal{L}\lambda_{\mathrm{contrast}}\mathcal{L}*{\mathrm{contrast}} + \lambda*{\mathrm{caption}}\mathcal{L}_{\mathrm{caption}}. ]\]

BLIP 则从数据工程角度引入 caption bootstrapping:

  1. 使用 captioner 为图像生成更丰富的描述;
  2. 使用过滤器删除低质量图文对;
  3. 同时支持理解任务和生成任务。

BLIP-2 进一步提出 Q-Former,以一个轻量 Querying Transformer 连接冻结的视觉编码器和冻结的语言模型,大幅降低了视觉—语言联合训练的参数和计算成本。

从这一阶段开始,Text–Image Pretraining 与多模态大模型的界限开始变得模糊。


3.3 第三阶段:通用视觉感知预训练

2025 年之后,研究目标再次发生变化。

领先模型不再只追求 ImageNet 零样本分类和 COCO 图文检索,而是开始系统优化:

  • 定位;
  • 分割;
  • 深度估计;
  • OCR;
  • 文档理解;
  • 长文本;
  • 多语言;
  • 原始宽高比;
  • 图像和视频统一;
  • 多模态大模型视觉 Token 质量。

这一阶段的目标已经不只是学习一个图文相似度空间,而是训练一个通用视觉感知底座。

一个更完整的训练目标可以写成:

\[[ \mathcal{L}\lambda_g\mathcal{L}*{\mathrm{global}} + \lambda_l\mathcal{L}*{\mathrm{local}} + \lambda_c\mathcal{L}*{\mathrm{caption}} + \lambda_s\mathcal{L}*{\mathrm{self\text{-}supervised}} + \lambda_r\mathcal{L}_{\mathrm{relation}}. ]\]

其中:

  • ($$\mathcal{L}_{\mathrm{global}}$$) 负责整图—整句对齐;
  • ($$\mathcal{L}_{\mathrm{local}}$$) 负责区域—短语或 Patch—文本对齐;
  • ($$\mathcal{L}_{\mathrm{caption}}$$) 提供细节和关系监督;
  • ($$\mathcal{L}_{\mathrm{self\text{-}supervised}}$$) 保留低层视觉结构;
  • ($$\mathcal{L}_{\mathrm{relation}}$$) 学习对象之间的组合关系。

四、2025—2026 年值得关注的模型

4.1 SigLIP 2:从强图文编码器走向通用视觉编码器

SigLIP 2 是当前最具代表性的开放视觉—语言编码器之一。

它没有简单地继续扩大模型,而是在原有 sigmoid 图文对齐目标上整合了:

  • captioning-based pretraining;
  • self-distillation;
  • masked prediction;
  • online data curation;
  • 多语言数据;
  • 去偏数据配比;
  • 多分辨率和原始宽高比训练。

SigLIP 2 发布了 ViT-B、ViT-L、So400m 和 ViT-g 等多个规模。相较原始 SigLIP,它不仅在零样本分类和图文检索上有所改善,在定位、密集预测以及作为 VLM 视觉编码器时也表现出更强的迁移能力。

SigLIP 2 最重要的启示并不是 sigmoid loss 本身,而是:

一个通用视觉编码器需要同时接受语言监督和视觉自监督,不能让所有视觉信息都被压缩成文本能够直接描述的全局语义。

SigLIP 2 的 NaFlex 版本还允许保留输入图像的原始宽高比。这对于文档、网页截图、OCR、遥感图像和长图尤其重要,因为强制裁剪为正方形可能破坏文字布局和空间结构。


4.2 Perception Encoder:最好的视觉特征可能不在最后一层

Meta 在 2025 年发布的 Perception Encoder 提出了一个非常值得重视的结论:

最适合通用视觉任务的特征,往往隐藏在视觉网络的中间层,而不是最后一层。

在 CLIP 式训练中,网络最后几层会不断将视觉特征压缩到与文本 embedding 对齐的空间。这个过程有利于图文检索和语义分类,却可能损失:

  • 空间布局;
  • 几何结构;
  • 深度信息;
  • 边缘和纹理;
  • 小目标细节。

Perception Encoder 因此设计了两类对齐方法:

  • Language Alignment:提取适合多模态语言模型的特征;
  • Spatial Alignment:提取适合检测、深度、分割和跟踪的特征。

该模型在图像和视频分类、检索、文档问答、视频问答、检测、深度估计和跟踪等任务上进行了统一评估。

这一发现对多模态大模型架构有直接影响。

传统架构通常只取视觉编码器的最后一层:

\[[ F=F_L. ]\]

未来更合理的做法可能是使用多层特征:

\[[ F= \sum_{l\in\mathcal{S}} \alpha_l(x,q)P_l(F_l), ]\]

其中:

  • ($$F_l$$) 是第 (l) 层视觉特征;
  • ($$P_l$$) 是层间投影器;
  • ($$\alpha_l(x,q)$$) 根据图像和问题动态分配权重。

例如,分类问题可以更多使用后层语义特征,OCR、定位和深度问题则可以更多使用中间层空间特征。


4.3 AIMv2:用自回归生成训练视觉编码器

AIMv2 代表了另一条重要路线:不再只通过图文匹配训练视觉编码器,而是让模型自回归预测图像 Patch 和文本 Token。

其基本结构包含:

  • 一个视觉编码器;
  • 一个多模态自回归解码器;
  • 图像 Patch 预测;
  • 文本 Token 预测。

训练目标可以简化为:

\[\mathcal{L}_{\mathrm{AIMv2}}\mathcal{L}*{\mathrm{image\ patch}} + \mathcal{L}*{\mathrm{text\ token}}. ]\]

与 CLIP 每个图文对主要提供一个全局匹配信号不同,AIMv2 可以从每个视觉 Patch 和文本 Token 中获得监督,因此更有机会保留细粒度视觉内容。

论文报告 AIMv2-3B 在冻结视觉主干的 ImageNet-1K 评估中达到 89.5%,并在定位、grounding、分类和多模态图像理解任务上展示出较强能力。

这条路线的核心判断是:

一个优秀的多模态大模型视觉编码器,不仅应该知道“这张图和哪句话匹配”,还应该包含足够的信息来解释甚至重建图像内容。

不过,AIMv2 更偏向通用视觉理解和多模态生成,并不必然是大规模图文向量检索中最经济的方案。


4.4 MetaCLIP 2:从英文互联网扩展到全球互联网

早期 CLIP 数据和 benchmark 明显偏向英文及西方互联网内容。

MetaCLIP 2 试图解决两个问题:

  1. 如何从多语言全球网页中收集和整理图文数据;
  2. 如何避免多语言训练导致英文能力下降,即所谓的 multilinguality curse。

MetaCLIP 2 通过全球化 metadata 构建、语言平衡和数据分布控制,让英文和非英文数据产生互补,而不是简单竞争训练容量。论文报告其 ViT-H/14 在英文 ImageNet 零样本分类以及 CVQA、Babel-ImageNet、XM3600 等多语言评测上取得了较强结果。

它说明多语言视觉—语言学习并不是“把 caption 翻译成更多语言”那么简单,而是一个涉及以下问题的数据工程系统:

  • 不同语言的数据比例;
  • 不同文化概念的覆盖率;
  • 长尾实体采样;
  • 语言质量差异;
  • 同一视觉概念在不同语言中的表达差异。

4.5 FG-CLIP 与 FG-CLIP 2:细粒度与中英双语对齐

CLIP 使用的大量网页文本往往很短,例如:

A dog in a park.

但真正的细粒度视觉理解可能需要:

A small brown dog wearing a red collar is running behind a yellow ball on the left side of a grassy park.

两者提供的监督密度完全不同。

FG-CLIP 通过三类数据增强细粒度能力:

  • 16 亿长描述图文对;
  • 1200 万图像和约 4000 万区域框—文本标注;
  • 1000 万细粒度 hard negative。

这些数据用于强化对象属性、局部区域、视觉关系和近义描述之间的区分。

FG-CLIP 2 则将这一方向扩展到中英双语,加入:

  • region-text matching;
  • long-caption modeling;
  • 多种判别式目标;
  • Textual Intra-modal Contrastive loss;
  • 中文长文本和区域级数据;
  • 中英文共享视觉语义空间。

FG-CLIP 2 在 29 个数据集和 8 类任务上进行了评估,目标包括中英文检索、细粒度分类、区域理解和开放词汇视觉任务。

对于中文电商、工业视觉、商品检索、内容审核和中文多模态大模型,这条路线尤其值得关注。


4.6 TIPSv2:从整图—文本对齐推进到 Patch—文本对齐

TIPSv2 聚焦一个长期存在却容易被忽略的问题:

模型的全局图文 embedding 很强,并不意味着单个视觉 Patch 能够与对应文本概念准确对齐。

例如一张包含汽车、行人、路牌和红绿灯的图片,CLIP 可能知道整张图属于“城市道路”,但未必能够让每一个 Patch 分别对应汽车、行人和红绿灯。

TIPSv2 使用 patch-level distillation 和改进的 iBOT 式视觉自监督训练,提高视觉 Patch 与文本概念的密集对齐能力。论文观察到,经过 Patch 级蒸馏后,学生模型的 Patch—文本对齐甚至能够超过教师模型。

TIPSv2 可以直接利用 Patch 和类别文本之间的相似度进行零样本分割,而不依赖额外的复杂后处理。

这一方向对于以下任务非常关键:

  • 开放词汇语义分割;
  • referring expression grounding;
  • 区域级检索;
  • 密集视觉 Token;
  • 机器人目标定位;
  • 多模态大模型局部证据提取。

4.7 MobileCLIP 2:端侧模型的竞争转向数据蒸馏

MobileCLIP 2 关注低延迟和端侧部署。

它延续 Multi-Modal Reinforced Training,通过多个教师模型和 caption generator 为小模型提供更丰富的训练信号。其关键改进包括:

  • 更强的 CLIP teacher ensemble;
  • 更丰富的合成 caption;
  • 多 caption generator 联合蒸馏;
  • 对比蒸馏温度参数调优;
  • 针对低延迟架构的训练优化。

MobileCLIP 系列面向约 50M 到 150M 参数及毫秒级推理场景。MobileCLIP 2 的实验说明,在小模型场景下,teacher 质量、caption 多样性和蒸馏 recipe 往往比继续修改轻量网络结构更重要。


4.8 TuringViT:动态分辨率与线性注意力

TuringViT 是 2026 年发布的一项视觉编码器工作,主要尝试降低高分辨率和动态分辨率预训练的成本。

其设计包括:

  • Turing Linear Attention;
  • 动态分辨率预训练;
  • 原始宽高比图像输入;
  • 图像—视频数据整理;
  • 面向 VLM 的统一视觉训练流程。

论文中的主要模型使用约 8.5 亿图文对训练,并在图像分类、图文检索、密集预测、视频迁移和下游 VLM 上进行了评估。

它反映了一个越来越明确的趋势:

视觉编码器不能继续假设所有输入都是固定的 (224\times224) 或 (384\times384) 正方形图像。

在文档、网页、遥感、工业质检和视频场景中,视觉编码器需要原生支持:

  • 不同宽高比;
  • 不同 Token 数量;
  • 不同空间分辨率;
  • 不同时间长度;
  • 动态计算预算。

4.9 LIFT 与 CLIMP:两条值得跟踪的探索路线

LIFT 提出,不一定需要同时训练图像编码器和文本编码器。它固定一个预训练 LLM 的文本编码空间,只训练视觉编码器与其对齐。论文报告,这种方法在长文本和组合性理解任务上能够超过其 CLIP 对照,同时降低联合训练成本。

CLIMP 则使用 Mamba 同时替代视觉和文本 Transformer 编码器,探索状态空间模型在图文对比预训练中的可行性。其目标包括:

  • 降低高分辨率计算复杂度;
  • 支持可变分辨率;
  • 改善长文本编码;
  • 提高部分分布外任务的鲁棒性。

论文报告 CLIMP 在 ImageNet-O 和超高分辨率检索实验中表现出一定优势,但这一方向仍需要更大规模训练和独立复现。


五、真正决定模型上限的,正在从架构转向数据

5.1 数据规模并不等于有效监督规模

CLIP 时代最直观的扩展方式是增加图文对数量。

但不同图文对提供的训练价值差异很大:

  • 图片与文本是否真正对应;
  • 文本是否描述视觉内容;
  • 文本是否包含细粒度信息;
  • 是否覆盖长尾概念;
  • 是否存在重复数据;
  • 是否包含有害偏差;
  • 是否覆盖非英文文化内容。

Data Filtering Networks 的研究表明,最适合做数据过滤的模型,并不一定是下游 ImageNet 准确率最高的模型。DFN-5B 所筛选的数据使 ViT-H 在论文实验中达到 84.4% 的 ImageNet 零样本准确率,并超过多个其他大规模数据集训练的对照模型。

这说明数据筛选器本身也需要专门设计和训练。


5.2 100B 数据实验:传统 benchmark 饱和,不代表数据扩展无效

2025 年的一项研究将视觉—语言预训练规模扩展到 1000 亿样本。

研究发现:

  • COCO 等传统、西方中心化的分类和检索 benchmark 逐渐饱和;
  • 文化多样性、长尾概念和低资源语言仍然持续受益;
  • 过强的 CLIP similarity filtering 可能删除非西方和文化长尾数据。

因此,“扩大数据已经没有价值”是一个错误结论。

更准确的判断是:

传统 benchmark 对数据覆盖率增长已经不够敏感,而真实世界多样性仍然需要更大规模、更广覆盖的数据。


5.3 Synthetic Caption 已成为标准组件

网页 alt-text 经常包含文件名、SEO 文本、无关描述或极短标签,因此越来越多模型使用多模态大模型生成合成 caption。

Synthetic Caption 可以补充:

  • 对象属性;
  • 空间位置;
  • 对象关系;
  • 背景环境;
  • OCR 内容;
  • 细粒度动作;
  • 视觉风格。

但 caption 并不是越长越好。

过长描述可能包含:

  • 模型幻觉;
  • 不可见知识;
  • 重复信息;
  • 与图像无关的推断;
  • 大量容易学习但没有视觉价值的语言模式。

因此,当前更合理的方法是混合使用:

  • 原始 alt-text;
  • 简短 caption;
  • 长 caption;
  • 区域 caption;
  • OCR 文本;
  • 结构化对象—属性—关系描述;
  • hard negative caption。

模型需要学习多种描述粒度,而不是只依赖一种“超长描述”。


5.4 从 Data Filtering 转向 Data Mixing

到了生成式 VLM 阶段,问题已经不再只是哪些图文对应该保留,而是不同类型的数据应该如何组合。

DataComp-VLM 汇总了 160 个数据集,覆盖:

  • image-caption pairs;
  • multimodal interleaved documents;
  • text-only data;
  • instruction-tuning data;

总规模约为 6T 多模态 Token,并支持在 1B 至 8B 模型、6.25B 至 200B Token 预算下进行受控实验。

其研究发现,在 VLM 训练中,data mixing 比单纯 filtering 更关键;随着模型和训练规模增长,instruction-heavy mixture 相比 caption-heavy mixture 的优势会进一步扩大。

这意味着 CLIP 时代的最佳数据策略,不能直接迁移到多模态大模型。

未来更重要的问题是:$$[ p_k(t)$$

\[P(\text{在训练阶段 }t\text{ 采样数据集}k)$$.] 不同阶段应动态调整: - 图文对; - OCR; - grounding; - 文档; - VQA; - 推理; - instruction; - 纯文本; 之间的采样比例。 ------ # 六、中文 Text–Image Pretraining 的新机会 中文视觉—语言预训练长期面临几个问题: - 高质量中文图文数据不足; - 数据年代较旧; - 短文本和标签文本占比过高; - 中文区域级标注稀缺; - 文化实体和本地知识覆盖不足; - OCR、文档和电商场景没有得到充分建模。 DanQing 在 2026 年发布了一个包含 1 亿中文图文对的数据集,主要来自 2024—2025 年网页数据,并通过持续预训练 SigLIP 2 验证了其在中文零样本分类、跨模态检索和 LMM 评测上的效果。 FG-CLIP 2 则将中文图文学习进一步推进到: - 中文长文本; - 区域—文本对齐; - 细粒度 hard negatives; - 中英共享 embedding; - 中文多模态 benchmark。 因此,下一代中文视觉—语言模型不应该只是 Chinese CLIP,而应该同时处理: $$[ \text{中文长文本} + \text{区域 Grounding} + \text{OCR/文档} + \text{文化长尾} + \text{中英统一语义空间}. ]\]

这一方向在电商搜索、工业视觉、广告审核、商品理解、中文文档和本地生活内容中具有很高的应用价值。


七、评测体系也必须发生变化

过去判断一个 Text–Image 模型是否优秀,通常只看:

  • ImageNet zero-shot accuracy;
  • COCO Retrieval Recall@K;
  • Flickr30K Retrieval;
  • 少量线性探测任务。

这些指标已经不足以判断视觉编码器是否适合作为通用感知底座。

AVA-Bench 将视觉能力拆分为 14 类原子能力,包括定位、深度和空间理解等,从而为不同视觉基础模型建立“能力指纹”。它还发现,使用较小语言模型作为统一评测头,也可以获得与更大语言模型相近的视觉编码器排名,从而显著降低评测成本。

未来视觉编码器至少应该从以下维度评估:

能力维度 代表任务
全局语义 零样本分类、图文检索
细粒度语义 属性识别、商品识别、物种识别
组合理解 属性绑定、对象关系、顺序和否定
空间感知 定位、深度、方向、计数
密集感知 分割、检测、Patch 检索
文字感知 OCR、文档、图表、网页
多语言 跨语言检索、文化实体理解
鲁棒性 OOD、遮挡、低分辨率、域迁移
视频能力 动作、时序、视频检索
VLM 迁移 作为 MLLM 视觉编码器的表现
部署效率 延迟、显存、吞吐、Token 数量

“哪个视觉编码器最好”并不存在一个单一答案。

DINO 式视觉自监督模型可能更擅长空间和几何信息,CLIP/SigLIP 式语言监督模型可能更擅长开放语义和 OCR,而 AIMv2、SigLIP 2 和 Perception Encoder 等混合路线则试图在两者之间取得平衡。


八、实际项目中应该如何选择模型?

8.1 通用分类与图文检索

优先考虑:

  • SigLIP 2;
  • MetaCLIP 2;
  • FG-CLIP 2;
  • MobileCLIP 2。

如果强调多语言,可以优先比较 MetaCLIP 2 和 SigLIP 2;如果强调中文和细粒度检索,则应重点评估 FG-CLIP 2。


8.2 多模态大模型视觉编码器

优先考虑:

  • SigLIP 2;
  • Perception Encoder;
  • AIMv2;
  • TuringViT。

但模型选择不能只比较冻结编码器的 ImageNet 准确率。

更合理的受控实验应该固定:

  • 相同 LLM;
  • 相同 projector;
  • 相同训练数据;
  • 相同视觉 Token 数;
  • 相同输入分辨率;
  • 相同训练步数。

否则最终差异可能来自 Token 数量、数据配比或连接器,而不是视觉编码器本身。


8.3 开放词汇检测、分割和 Grounding

优先关注:

  • TIPSv2;
  • FG-CLIP 2;
  • Perception Encoder Spatial;
  • SigLIP 2。

这类任务应重点评估 Patch 和 Region 特征,而不是只使用全局 CLS Token。


8.4 文档、网页和 OCR

需要优先关注:

  • 原始宽高比;
  • 动态分辨率;
  • 高分辨率 Token 效率;
  • 小文字保留能力;
  • 中间层空间特征。

SigLIP 2 NaFlex、FG-CLIP 2、TuringViT 以及面向文档定制的视觉编码器,都比固定正方形低分辨率 CLIP 更适合作为起点。


8.5 移动端和实时应用

优先考虑:

  • MobileCLIP 2;
  • 较小规模 SigLIP 2;
  • 经过蒸馏的领域模型。

在端侧场景中,模型参数量不是唯一指标,还需要实际测试:

  • 图像预处理时间;
  • 编码延迟;
  • 内存峰值;
  • 向量维度;
  • 批处理吞吐;
  • 不同硬件后端的算子支持。

九、未来值得研究的五个方向

9.1 Layer-Adaptive Visual Token

视觉编码器不再只提供最后一层,而是让系统根据任务动态选择不同层级。

\[[ F= \sum_l \alpha_l(q,x)P_l(F_l). ]\]

这是连接全局语义、局部空间和动态计算的一个重要方向。


9.2 Global–Local–Relational 三层对齐

未来的视觉—语言预训练应该同时建立:

  1. 整图—整句对齐;
  2. 区域—短语对齐;
  3. 对象关系—语言关系对齐。

可以使用统一目标:

\[\mathcal{L}\mathcal{L}*{image-text} + \mathcal{L}*{region-phrase} + \mathcal{L}*{patch-token} + \mathcal{L}*{relation-triplet}. ]\]

单纯增加 caption 长度,并不能保证模型真正学会属性绑定和关系推理。


9.3 Objective Curriculum

与其从训练第一步开始固定叠加所有损失,更合理的方法可能是分阶段学习:

  1. 视觉自监督初始化;
  2. 全局图文对齐;
  3. caption generation;
  4. Patch/Region 对齐;
  5. 组合性 hard negatives;
  6. 与目标 LLM 的深度对齐。

不同阶段优化不同能力,可以减少多目标之间的梯度冲突。


9.4 Task-Aware Dynamic Resolution

未来模型可以根据图像类型和用户问题选择分辨率。

例如:

  • 普通场景分类使用较低分辨率;
  • OCR 和文档使用高分辨率;
  • Grounding 使用局部裁剪;
  • 视频任务动态分配时间和空间 Token;
  • 简单问题减少视觉 Token;
  • 复杂问题保留更多局部证据。

其目标可以写成:

\[[ \max_{\pi(x,q)} \operatorname{Utility}(\pi) \quad \mathrm{s.t.} \quad \operatorname{Cost}(\pi)\le B. ]\]

其中 (\(\pi(x,q)\)) 是视觉编码策略,(B) 是 Token 或计算预算。


9.5 从 Image–Text 走向 Image–Video–Text–Action

Text–Image Pretraining 的下一阶段,很可能不再局限于静态图像。

未来的预训练数据会逐渐包含:

  • 图像;
  • 视频;
  • 音频;
  • 文本;
  • 动作;
  • 状态转移;
  • 交互轨迹。

静态图文对齐学习的是:

\[[ P(\text{text}\mid\text{image}), ]\]

而具身智能和世界模型需要进一步学习:

\[[ P(s_{t+1}\mid s_t,a_t,\text{text}). ]\]

因此,Text–Image Pretraining 很可能成为更广义的视觉—语言—动作预训练的基础阶段,而不是终点。


十、结语

回顾过去五年,Text–Image Pretraining 的演进路径非常清晰:

  • CLIP 证明了自然语言可以替代固定类别标签;
  • ALIGN 证明了数据规模能够部分抵消网页噪声;
  • SigLIP 改进了大规模图文对齐目标;
  • CoCa 和 BLIP 将对比学习与生成学习结合;
  • BLIP-2 建立了视觉编码器与大语言模型之间的高效桥梁;
  • AIMv2 探索了生成式视觉编码器;
  • SigLIP 2 将对比、生成、自监督、多语言和动态分辨率整合为统一 recipe;
  • Perception Encoder 揭示了中间层视觉表示的价值;
  • FG-CLIP 2 推进了中英双语与细粒度区域对齐;
  • TIPSv2 将竞争焦点推进到 Patch—Text Alignment;
  • DataComp-VLM 则进一步表明,数据配比正在超越单纯的数据过滤,成为决定 VLM 能力的重要变量。

因此,未来真正有竞争力的视觉编码器,不会只是一个“更大的 CLIP”。

它需要同时具备:

  • 语言可解释的全局语义;
  • 可定位的局部视觉证据;
  • 可组合的对象关系;
  • 可扩展的多语言空间;
  • 可适配的分辨率和 Token 预算;
  • 可迁移到图像、视频、文档、Agent 和机器人系统的统一表示。

Text–Image Pretraining 正在从“对齐两种模态”,转向“构建机器理解视觉世界的通用表示”。

而这场变化,才刚刚开始。

posted @ 2026-07-31 17:59  Xu_Lin  阅读(14)  评论(0)    收藏  举报