在大型语言模型(LLM)处理长文本时,计算开销一直是瓶颈。幻方团队的最新论文《DeepSeek-OCR: Contexts Optical Compression》另辟蹊径,提出用视觉模态压缩文本信息,实现高效 OCR 识别。本文将深入解读其核心思想、架构设计与实验结果,带你领略这一创新思路的魅力。
核心思想:一图胜千言,视觉压缩文本
传统 OCR 遵循“检测-识别-匹配”的流水线,而 DeepSeek-OCR 则模仿人类阅读:通过视觉捕捉文字图像,将其压缩为 token,再经解码器还原为文本。这种“视觉压缩-文本恢复”框架的核心在于,一张图片能承载大量文字信息,用更少的视觉 token 表示相同内容,从而缓解 LLM 的长上下文压力。

翻译:
我们提出了 DeepSeek-OCR,作为对通过光学二维映射压缩长上下文可行性的初步研究。
该模型由两个部分组成:DeepEncoder 与作为解码器的 DeepSeek3B-MoE-A570M。其中,DeepEncoder 是核心引擎,旨在在高分辨率输入下保持低激活内存的同时,实现高压缩比,以确保视觉 token 数量最优且可控。实验结果表明,当文本 token 数量是视觉 token 数量的 10 倍以内(即压缩比 <10×)时,模型可实现 97% 的解码(OCR)精度;即使在 20× 压缩下,准确率仍保持在 约 60%。
这显示了该方法在 长上下文压缩与记忆遗忘机制 等研究方向上的潜力。此外,DeepSeek-OCR 还具有很高的实用价值:在 OmniDocBench 基准上,仅使用 100 个视觉 token 即超越 GOT-OCR2.0(256 tokens/page) 的性能,并在使用少于 800 个视觉 token 的情况下优于 MinerU2.0(平均6000+ tokens/page)。
在生产环境中,DeepSeek-OCR 可在单卡(A100-40G)上每日生成超过 20 万页 的 LLM/VLM 训练数据。代码与模型权重已在 GitHub 公布。
实验数据验证了这一思路的可行性:在 Fox 数据集上,10 倍压缩比下 OCR 精度高达 97%,20 倍压缩比时仍保持 60%。这意味着即使是紧凑模型也能有效解码视觉压缩表示,为大规模应用奠定基础。

研究动机:从 VQA 到 LLM 视角的转变
作者强调,应将视觉语言模型(VLM)的设计从“视觉问答”转向“LLM 视角”——让视觉编码器辅助 LLM 高效读取文本。OCR 任务成为天然测试平台,因为它本身就是视觉与语言的桥梁:图像是压缩的文本,OCR 识别是解压缩过程,且评估指标明确(如识别准确率)。

当前大型语言模型(LLMs)在处理长文本内容时面临显著的计算挑战,因为其计算量随序列长度呈二次方增长。我们探索一种潜在的解决方案:利用视觉模态作为高效的文本信息压缩媒介。一张包含文档文字的图像可以用远少于等价数字文本的 token 表示丰富的信息,这暗示通过视觉 token 进行光学压缩可以实现更高的压缩率。
这种视角转变意味着,我们不再追求模型“看懂”图像,而是利用视觉编码器提升 LLM 处理文本信息的效率。这一思路在 Python、Go、C++ 等编程语言的文档处理场景中尤为实用——例如,将代码截图直接转化为可编辑文本,或从技术文档中提取关键信息。

这一观点促使我们从LLM中心的角度重新审视视觉-语言模型(VLMs),重点研究视觉编码器如何提高LLM处理文本信息的效率(而不是像视觉问答等人类擅长的任务)。作为介于视觉和语言之间的中间形式,OCR任务提供了该视觉-文本压缩范式的理想测试平台,因为它们建立了视觉和文本表征之间自然的压缩-解压映射,同时提供了定量评估指标。
三大核心贡献:定量验证、架构创新与系统实现
论文的贡献可归纳为三方面。首先,对视觉-文本压缩比进行了全面定量分析,证明 9-10 倍压缩时精度 >96%,20 倍时约 60%。其次,提出了新颖的视觉编码器 DeepEncoder,兼顾高分辨率与低 token 数。最后,基于此构建了 DeepSeek-OCR 系统,在 OmniDocBench 上以最少视觉 token 达到最先进性能。

为此,我们提出了 DeepSeek-OCR,这是一种作为有效视觉-文本压缩的初步概念验证的视觉-语言模型。我们的工作有以下三大主要贡献:
第一,我们提供了对视觉-文本token压缩率的全面定量分析。我们的方法在Fox基准(包含多样化文档布局)上,在9-10倍文本压缩率时实现了96%+的OCR解码精度,10-12倍时约90%,20倍时约60%(若考虑输出与真值的格式差异,实际准确率更高),如图1(a)所示。结果表明,即使是紧凑型的语言模型也能有效地学习解码压缩的视觉表征,这暗示通过合适的预训练设计,更大的LLM也可以轻松获得类似能力。
第二,我们提出了DeepEncoder,这是一种新颖的架构,即使在高分辨率输入下也能保持低激活内存并产生极少量的视觉token。它通过一个16×卷积压缩器将窗口注意力和全局注意力编码组件串联连接。该设计确保窗口注意力部分可以处理大量视觉token,而在进入密集的全局注意力部分之前通过压缩器显著减少视觉token数量,从而实现了有效的内存和token压缩。
第三,我们基于DeepEncoder和DeepSeek3B-MoE [19, 20]开发了DeepSeek-OCR。如图1(b)所示,它在端到端模型中以使用最少视觉token的条件下,在OmniDocBench上取得了最先进的性能。此外,我们赋予模型解析图表、化学公式、简单几何图形和自然图像的能力,以进一步提升其实用性。在实际生产环境中,DeepSeek-OCR使用20台节点(每台配备8个A100-40G GPU)每天可以为LLMs或VLMs生成3300万页训练数据。
这些贡献不仅为 LLM 长上下文问题提供新方向,还能指导未来 VLM 的资源分配策略。例如,在 TypeScript 或 JavaScript 项目中,开发者可快速将大量文档截图转为结构化数据,提升开发效率。

总而言之,本工作提出并初步探索了使用视觉模态作为LLMs文本信息处理中的高效压缩媒介。通过DeepSeek-OCR,我们证明了视觉-文本压缩可以在不同历史上下文阶段实现7-20倍的显著token减少,为解决大型语言模型中的长上下文问题提供了一个有前景的方向。我们的定量分析为VLM的token分配优化提供了经验指导,而所提的DeepEncoder架构则展示了在实际部署中的可行性。虽然本研究以OCR任务作为概念验证,但这一范式为重新思考视觉和语言模态如何协同提高大规模文本处理和智能体系统的计算效率开辟了新可能。
相关研究:现有视觉编码器的局限
论文回顾了现有 VLM 中的三类编码器:双塔架构(如 Vary)部署复杂;分块处理(如 InternVL2.0)产生过多 token;自适应分辨率(如 Qwen2-VL)内存消耗巨大。这些方案均无法同时满足高分辨率、低激活内存、少 token 的需求,从而引出 DeepEncoder 的设计。


当前开源的VLM使用三种主要类型的视觉编码器,如图2所示。第一类是以Vary [36]为代表的双塔架构,它采用并行的SAM [17]编码器来扩大视觉词汇以处理高分辨率图像。虽然这种方法具有可控的参数规模和激活内存,但存在显著缺点:它需要对图像进行双重预处理,这增加了部署复杂度,并且在训练时导致编码器流水线并行化变得困难。第二类是以InternVL2.0 [8]为例的基于切片(tile)的处理方法,它将图像划分为小块进行并行计算,从而在高分辨率设置下减少激活内存消耗。虽然该方法能处理极高分辨率,但由于其原生编码器分辨率通常很低(低于512×512),导致大图像被过度切割,产生大量视觉token,这是一大局限。第三类是以Qwen2-VL [35]为代表的自适应分辨率编码,它采用NaViT [10]范式,通过基于patch的分割直接处理完整图像,而不进行切片并行。虽然该编码器能灵活应对多种分辨率,但在处理大图像时面临巨大挑战:海量激活内存消耗可能导致GPU内存溢出,同时序列打包需要极长序列长度进行训练,长序列的视觉token会拖慢推理阶段的填充和生成速度。
在端到端 OCR 模型方面,现有研究未回答“需要多少视觉 token 才能恢复一定量文本”这一根本问题,而 DeepSeek-OCR 正是要定量回答它。

OCR,尤其是文档解析任务,一直是图像到文本领域的热点话题。随着VLM的发展,大量端到端OCR模型应运而生,从根本上简化了传统的流水线架构(传统OCR需要分开进行文本检测和识别),极大提升了OCR系统的简洁性。Nougat [6]首次在arXiv学术论文OCR中采用端到端框架,展示了模型处理高密度文本的潜力。GOT-OCR2.0 [38]将OCR2.0的范围扩大到更多合成图像解析任务,并设计了兼顾性能和效率的OCR模型,进一步凸显了端到端OCR研究的潜力。此外,Qwen-VL系列 [35]、InternVL系列 [8] 等通用视觉模型及其众多衍生模型不断增强文档OCR能力,以探索视觉感知的极限。然而,目前的模型尚未解决一个关键问题:对于包含1000个单词的文档,至少需要多少视觉token才能实现解码?这个问题对于验证“百字图胜千言”这一原则具有重要意义。
️ 方法论:DeepEncoder 与多分辨率策略
DeepSeek-OCR 采用“编码器-解码器”架构:编码器约 380M 参数(SAM-base 80M + CLIP-large 300M 串联),解码器为 3B MoE 模型(仅激活 570M)。核心创新在于 DeepEncoder 的串联设计:先用窗口注意力高效处理大量 token,再通过 16 倍卷积下采样压缩 token 数,最后由全局注意力融合语义。


如图3所示,DeepSeek-OCR采用统一的端到端VLM架构,由一个编码器和一个解码器组成。编码器(即DeepEncoder)负责提取图像特征,并将视觉信息进行token化和压缩;解码器则用于基于图像token和提示生成所需的文本输出。DeepEncoder的参数量约为380M,主要由一个80M的SAM-base [17]和一个300M的CLIP-large [29]串联组成。解码器采用一个3B参数量的MoE架构,激活参数约570M。下面的内容将详细介绍模型组件、数据处理及训练策略。
以 1024×1024 输入为例,SAM 将其分割为 4096 个 token,经卷积压缩后仅剩 256 个,大幅降低后续计算开销。这种设计平衡了效率与性能,适用于 Python 或 Go 等语言处理大规模文档。

为了探索上下文光学压缩的可行性,我们需要一个具有以下特征的视觉编码器:1. 能够处理高分辨率输入;2. 在高分辨率下仍保持低激活内存占用;3. 生成极少量的视觉token;4. 支持多种分辨率输入;5. 参数规模适中。然而,如第2.1节所述,目前开源的编码器并不能同时满足所有这些条件。因此,我们自行设计了一个新的视觉编码器,命名为DeepEncoder。


DeepEncoder主要由两个部分组成:一个以窗口注意力为主的视觉感知特征提取组件,以及一个具有密集全局注意力的视觉知识提取组件。为了利用之前工作的预训练成果,我们分别采用SAM-base(patch大小16)和CLIP-large作为这两个部分的主干网络。对于CLIP模块,我们去掉了其第一个patch嵌入层,因为其输入不再是原始图像而是前一模块的输出token。在这两部分之间,我们借鉴Vary [36]的思路,使用一个两层卷积模块对视觉token进行16倍下采样。每个卷积层的卷积核大小为3,步幅为2,填充为1,通道数从256增加到1024。假设输入一幅1024×1024的图像,DeepEncoder会将其分割成1024/16 × 1024/16 = 4096个patch token。由于编码器的前半部分由80M参数的窗口注意力模块主导,其激活内存消耗可控。在进入全局注意力之前,这4096个token经过压缩模块处理后,token数量缩减为4096/16 = 256,从而使整体激活内存可控。
多分辨率支持:灵活应对不同文本量
现实场景中,文档长度差异巨大。DeepEncoder 支持原生分辨率(Tiny: 512×512, Small: 640×640, Base: 1024×1024, Large: 1280×1280)和动态分辨率(如 Gundam 模式:n 个 640×640 切片 + 1 个 1024×1024 全局视图),通过动态插值位置编码适应不同输入尺寸。

假设我们有一张包含1000个字符的图像,并希望测试需要多少视觉token才能完成解码。这要求模型能支持可变数量的视觉token。换言之,DeepEncoder需要支持多种分辨率输入。


我们通过对位置编码进行动态插值来满足上述要求,并设计了若干分辨率模式同时训练,使得同一个DeepSeek-OCR模型能够支持多种分辨率。如图4所示,DeepEncoder主要支持两种输入模式:原生分辨率和动态分辨率,每种模式包含多个子模式。
例如,处理报纸等超高分辨率图像时,Gundam 模式输出 token 数为 n×100 + 256(n 在 2-9 之间),既避免过度碎片化,又保持高效。

原生分辨率支持四个子模式:Tiny、Small、Base和Large,对应的输入尺寸和视觉token数分别为512×512 (64)、640×640 (100)、1024×1024 (256)和1280×1280 (400)。由于Tiny和Small模式的分辨率较小,为避免浪费视觉token,输入图像直接按比例缩放至对应大小。对于Base和Large模式,为保留原始图像的纵横比,先将图像填充到对应尺寸。填充后,有效的视觉token数量少于实际的token数量,其计算公式为:
W和h表示原始输入图像的宽和高。

动态分辨率可以由两种原生分辨率组合而成。例如,Gundam模式由n个640×640大小的分片(局部视图)和一个1024×1024全局视图构成(分片切分方法参考InternVL2.0 [8])。引入动态分辨率主要是为了应用考虑,特别是针对超高分辨率输入(如报纸图像)。分片处理实际上是一种二次窗口注意力,可进一步降低激活内存消耗。值得注意的是,由于我们的原生分辨率已经较大,在动态分辨率下图像不会被过度切碎(分片数控制在2到9之间)。在Gundam模式下DeepEncoder输出的视觉token数为:n × 100 + 256,其中n是分片数量。对于宽高都小于640的图像,将n设为0,即Gundam模式退化为Base模式。

[AFFILIATE_SLOT_1]Gundam模式与四种原生分辨率模式一同训练,以实现单模型支持多种分辨率的目标。需要注意的是,Gundam-master模式(1024×1024局部视图+1280×1280全局视图)是在已训练的DeepSeek-OCR模型基础上继续训练得到的。这主要是为了负载均衡,因为Gundam-master的分辨率过大,如果和其他模式同时训练会使整体训练速度变慢。
实验结果:性能与效率的权衡
在 Fox 基准上,DeepSeek-OCR 展示了不同压缩比下的精度变化:10 倍压缩时精度 >96%,20 倍时约 60%。在 OmniDocBench 上,它以最少视觉 token 达到最先进性能,超越了现有模型。此外,系统每天可处理 20 万+页面,为 LLM/VLM 生成训练数据,工程价值显著。

我们的解码器使用DeepSeekMoE [19, 20],具体为DeepSeek-3B-MoE。在推理过程中,模型会激活64个专家路由中的6个专家和2个共享专家,大约570M个参数被激活。这种3B规模的DeepSeekMoE非常适合领域专用(此处为OCR)的VLM研究,因为它同时具备3B模型的表达能力和500M小模型的推理效率。
解码器从DeepEncoder输出的压缩潜在视觉token重建原始文本表示:
,
其中表示来自DeepEncoder的压缩视觉token,表示重建的文本表示。函数代表一个非线性映射,通过类似OCR风格的训练,紧凑的语言模型可以有效学习该映射。我们可以合理推测,通过专门的预训练优化,更大的LLM将能够更自然地整合这类能力。
我们为DeepSeek-OCR构建了复杂多样的训练数据集,包含OCR 1.0数据(主要涵盖场景图像OCR和文档OCR等传统OCR任务)、OCR 2.0数据(主要包含常见图表、化学公式、平面几何等复杂人工图像的解析任务)以及通用视觉数据。其中通用视觉数据主要用于为DeepSeek-OCR注入特定的通用图像理解能力,同时保持其通用视觉接口的完整性。
这些结果证明,视觉压缩文本是一种可行且高效的方法,尤其适合 C++ 或 JavaScript 开发者处理技术文档、代码截图等场景。
文档数据是DeepSeek-OCR的首要任务。我们从互联网收集了涵盖约100种语言的3000万页多样化PDF数据,其中中文和英文约占2500万页,其他语言约占500万页。针对这些数据,我们创建了两种类型的基准数据:粗标注和细标注。粗标注通过fitz工具直接从完整数据集中提取,旨在训练模型识别光学文本,尤其针对少数民族语言。细标注包含中文和英文各200万页,采用先进的布局模型(如PP-DocLayout[33])和OCR模型(如MinuerU[34]、GOT-OCR2.0[38])进行标注,构建检测与识别交织的数据集。对于少数民族语言,我们在检测阶段发现布局模型具有一定的泛化能力。在识别阶段,我们使用fitz生成小块数据训练GOT-OCR2.0模型,再利用训练好的模型对布局处理后的数据进行标注,通过模型飞轮机制生成60万数据样本。在DeepSeekOCR训练过程中,粗标注和细标注通过不同提示词进行区分。图5展示了OCR 1.0细标注的展示效果。精细标注图像-文本对的基准数据可参见图5。我们还收集了300万份Word数据,通过直接提取内容构建高质量的图像-文本对,无需布局。这些数据主要对公式和HTML格式表格有益。此外,我们还选取了一些开源数据[28,37]作为补充。
For natural scene OCR, our model mainly supports Chinese and English. The image datasources come from LAION [31] and Wukong [13], labeled using PaddleOCR [9], with 10M data samples each for Chinese and English. Like document OCR, natural scene OCR can also control whether to output detection boxes through prompts.
遵循GOT-OCR2.0 [38],我们将图表、化学公式和平面几何解析数据称为OCR 2.0数据。对于图表数据,按照OneChart [7]的方法,我们使用pyecharts和matplotlib生成1000万张图像,主要包括常用的折线图、柱状图、饼图和复合图表。我们将图表解析定义为图像到HTML表格的转换任务,如图6(a)所示。对于化学公式,我们利用PubChem的SMILES格式作为数据源,并使用RDKit将其渲染为图像,构建500万组图像-文本对。对于平面几何图像,我们遵循Slow Perception [39]的方法进行生成。具体而言,我们使用感知标尺大小为4来对每个线段进行建模。为了增加渲染数据的多样性,我们引入了几何平移不变性数据增强,即在原始图像中对同一几何图像进行平移,对应的地面真值在同一坐标系的中心位置绘制。基于此,我们构建了总计100万组平面几何解析数据,如图6(b)所示。
未来展望:视觉压缩的广泛应用
论文指出,虽然当前聚焦于 OCR,但视觉压缩文本的思路可拓展至更多场景,如图表、公式、自然图像理解等。这为 LLM 处理长序列提供了新范式,未来或将成为主流方法。

DeepEncoder能够受益于CLIP的预训练成果,并拥有足够的参数来整合通用视觉知识。因此,我们也为DeepSeek-OCR准备了一些相应的数据。遵循DeepSeek-VL2 [40]的方法,我们为诸如字幕生成、检测和定位等任务生成相关数据。需要注意的是,DeepSeek-OCR并非一个通用的视觉语言模型,这部分数据仅占总数据的20%。我们引入此类数据主要是为了保留通用的视觉接口,以便对我们模型及通用视觉任务感兴趣的研究人员未来能够便捷地推进他们的工作。

为确保模型的语言能力,我们引入了10%的内部纯文本预训练数据,所有数据均被处理为8192个标记的长度,这也是DeepSeek-OCR的序列长度。总结而言,在训练DeepSeek-OCR时,OCR数据占比70%,通用视觉数据占比20%,纯文本数据占比10%。

我们的训练流程非常简单,主要包括两个阶段:a). 独立训练DeepEncoder;b). 训练DeepSeek-OCR。需要注意的是,Gundam-master模式是通过在预训练的DeepSeek-OCR模型上使用600万采样数据继续训练而获得的。由于训练协议与其他模式相同,我们在此省略详细描述。

遵循Vary [36]的方法,我们采用了一个紧凑的语言模型[15],并利用下一个令牌预测框架来训练DeepEncoder。在此阶段,我们使用了前述的所有OCR 1.0和2.0数据,以及从LAION [31]数据集中抽取的1亿条通用数据。所有数据均训练2个周期,批次大小为1280,采用AdamW [23]优化器配合余弦退火调度器[22],学习率为5e-5。训练序列长度为4096。

在DeepEncoder准备就绪后,我们使用第3.4节中提到的数据来训练DeepSeek-OCR。整个训练过程在HAI-LLM [14]平台上进行。整个模型采用流水线并行(PP)技术,被划分为4个部分,其中DeepEncoder占据两部分,解码器占据另外两部分。对于DeepEncoder,我们将SAM和压缩器视为视觉分词器,将它们放置在PP0中并冻结其参数,同时将CLIP部分作为输入嵌入层,放置在PP1中,权重未冻结以进行训练。对于语言模型部分,由于DeepSeek3B-MoE有12层,我们将6层分别放置在PP2和PP3上。我们使用20个节点(每个节点配备8个A100-40G GPU)进行训练,数据并行(DP)度为40,全局批次大小为640。我们采用AdamW优化器,配合基于步数的调度器,初始学习率为3e-5。对于纯文本数据,训练速度为每天900亿个标记,而对于多模态数据,训练速度为每天700亿个标记。

选取Fox[21]基准测试集验证DeepSeek-OCR对文本密集文档的压缩-解压能力,以初步探索光学上下文压缩的可行性及边界。采用Fox英文文档部分,通过DeepSeek-OCR的分词器(词汇量约129k)对真实文本进行分词,筛选600-1300个token的文档作为测试集,恰好对应100页内容。由于文本token数量不大,仅需测试Tiny和Small两种模式:Tiny模式对应64个token,Small模式对应100个token。使用无版式提示词"<image>\nFree OCR."控制模型输出格式,但输出格式仍无法完全匹配Fox基准,因此实际性能会略高于测试结果。

如表2所示(表2在上文),在10倍压缩比范围内,该模型的解码精度可达约97%,这一结果极具前景。未来或许能通过文生图方法实现接近10倍的无损上下文压缩。当压缩比超过10倍时,性能开始下降,这可能存在两方面原因:其一是长文档的版面结构趋于复杂,其二可能是长文本在512×512或640×640分辨率下产生模糊。第一个问题可通过将文本渲染至单页版面来解决,而我们认为第二个问题将演变为遗忘机制的特征。当令牌压缩接近20倍时,我们发现精度仍能维持在60%左右。这些结果表明光学上下文压缩是极具潜力且值得探索的研究方向,且该方法不会产生额外开销——因其可复用视觉语言模型的基础设施,毕竟多模态系统本身就需要额外的视觉编码器。

DeepSeek-OCR不仅是一个实验性模型;它具备强大的实际能力,能够为LLM/VLM预训练构建数据。为量化OCR性能,我们在OmniDocBench[27]上测试了DeepSeek-OCR,结果如表3所示。仅需100个视觉标记(640×640分辨率),DeepSeek-OCR便超越了使用256个标记的GOT-OCR2.0[38];当使用400个标记(285个有效标记,1280×1280分辨率)时,其在该基准测试中达到了与最先进技术相当的性能。使用少于800个标记(高达模式)时,DeepSeek-OCR的表现优于需要近7000个视觉标记的MinerU2.0[34]。这些结果表明,我们的DeepSeek-OCR模型在实际应用中表现强劲,并且由于更高的标记压缩率,其研究上限也更高。

如表4所示,某些文档类别仅需少量视觉标记即可达到理想效果,例如幻灯片仅需64个视觉标记。对于书籍和报告类文档,DeepSeek-OCR仅需100个视觉标记即可实现良好性能。结合第4.1节的分析,这可能是因为这些文档类别的文本标记大多在1000以内,意味着视觉标记压缩比不超过10倍。对于报纸类文档,需要使用高达模式甚至高达大师模式才能达到可接受的编辑距离,因为报纸的文本标记数量为4000-5000,远超其他模式10倍的压缩比。这些实验结果进一步揭示了上下文光学压缩的局限性,为研究视觉标记在大语言模型中的优化及语言模型中的上下文压缩与遗忘机制提供了有效参考。

DeepSeek-OCR兼具布局识别与OCR 2.0功能,可通过二次调用模型实现文档内图像的深度解析,该功能我们称之为“深度解析”。如图7、8、9、10所示,我们的模型仅需统一提示即可对图表、几何图形、化学公式乃至自然图像进行深度解析。

互联网上的PDF数据不仅包含中文和英文,还包含大量多语言数据,这对训练大语言模型(LLM)至关重要。DeepSeekOCR可处理近100种语言的PDF文档。与中文和英文文档类似,多语言数据同样支持布局和非布局两种OCR格式。可视化结果如图11所示,我们选取阿拉伯语和僧伽罗语进行演示。
我们还为DeepSeek-OCR提供了一定程度的通用图像理解能力。相关可视化结果如图12所示。
本研究首次探索了视觉-文本压缩的边界,重点探究解码 文本所需的视觉标记数量。初步结果令人鼓舞:DeepSeek-OCR在约10倍压缩率下实现了近乎无损的OCR压缩,即便压缩至20倍仍保持60%的准确率。这些发现为未来应用指明了方向,例如通过光学处理实现多轮对话中 轮次之外的对话历史压缩,从而达到10倍的压缩效率。
对于较早的上下文信息,我们可以通过逐步缩小渲染图像尺寸来进一步降低令牌消耗。这一假设的灵感源自人类记忆随时间衰减与视觉感知随空间距离退化之间的自然对应关系——两者都呈现出类似的信息渐进性丢失模式,如图13所示。通过结合这两种机制,上下文光学压缩方法实现了模拟生物遗忘曲线的记忆衰减形式:近期信息保持高保真度,而远期记忆则会随着压缩比的提升自然淡出。
虽然我们的初步探索表明超长上下文处理具有可扩展潜力(近期上下文保持高分辨率,而旧上下文消耗更少资源),但我们承认这仍处于早期研究阶段,需要进一步探索。该方法为理论上的无限上下文架构指明了方向,这些架构在信息保留与计算约束之间取得平衡,不过此类视觉-文本压缩系统的实际应用价值与局限性,仍需未来研究进行更深入的探讨。
[AFFILIATE_SLOT_2]在本技术报告中,我们提出DeepSeek-OCR模型并初步验证了通过该模型实现上下文光学压缩的可行性,证明该模型能够有效解码数量超过10倍的视觉标记文本。我们相信这一发现将推动未来视觉语言模型(VLM)和语言模型(LLM)的发展。此外,DeepSeek-OCR是一个高度实用的模型,能够大规模生成预训练数据,成为LLM不可或缺的辅助工具。当然,仅凭OCR技术还不足以完全验证真正的上下文光学压缩效果,未来我们将开展数字-光学文本交替预训练、大海捞针测试等评估工作。从另一个角度来看,光学上下文压缩仍具有巨大的研究空间和改进潜力,代表着一个充满前景的新方向。
总结
DeepSeek-OCR 通过视觉压缩文本,为 LLM 处理长上下文提供了新思路。其核心贡献包括:定量验证压缩可行性、设计高效编码器 DeepEncoder、构建实用系统。这一工作不仅提升了 OCR 效率,也为未来 VLM 发展指明了方向。对于 Python、Go、C++ 等开发者而言,它意味着更高效的文档处理能力,值得深入研究和应用。
浙公网安备 33010602011771号