在需要从截图或扫描件中提取文字时,在线OCR平台要么限制次数、要么识别缓慢,更让人不放心的是图片数据要上传到他人服务器。付费订阅对于偶尔使用的人来说又显得不值。PaddleOCR-VL作为PaddleOCR 3.x系列的多模态文档解析模型,参数规模不到一亿,却能兼顾精度与资源消耗。它不仅能识别文字,还能理解文档结构——表格、公式、图表、多栏排版都能处理,支持超过100种语言,本地部署则彻底保障隐私。本文将通过整合包简化部署流程,让你轻松自建一套实用的OCR服务。
什么是PaddleOCR-VL?

PaddleOCR-VL是PaddleOCR 3.x系列中的一款视觉-语言多模态文档解析模型,专为复杂文档场景设计。与传统OCR仅能识别文字不同,PaddleOCR-VL通过融合视觉编码器与语言模型,实现了从“文字识别”到“图文理解”的跨模态能力。它不仅能精准提取文字,还能理解文字在文档中的结构和语义,例如表格、公式、图表以及多栏排版内容。
该模型参数规模适中(约0.9亿),兼顾高精度和资源效率,因此既适合本地部署,也可在私有云或远程环境中使用。更重要的是,PaddleOCR-VL支持多语言文本识别(超过100种语言),在处理多语种混排文档时表现出色。凭借其跨模态能力,它不仅可以完成大批量文档解析,还能为知识抽取、智能问答等后续任务提供结构化输入,成为现代智能文档处理系统的核心技术。
简而言之,PaddleOCR‑VL 是一款专业的多模态文档理解模型,突破了传统 OCR 的局限,实现了文字识别、版式理解与语义分析的有机结合。
PaddleOCR-VL下载与启动
由于官方开源代码的部署环境较为复杂,不适合新手小白上手,本教程将使用@十字鱼提供的整合包,让入门变得简单。整合包下载链接可访问cpolar官网同名文章。

下载整合包后,解压到本地目录。进入解压后的目录,双击执行 01运行程序.bat 脚本:

执行脚本后,会打开cmd窗口,检测电脑配置并下载模型:

启动完成后,会出现URL地址:

自动在浏览器中打开,如果未自动打开,手动访问如下地址:
http://127.0.0.1:7891

出现如上页面,PaddleOCR-VL整合包就启动完成!
简单使用PaddleOCR-VL
PaddleOCR-VL可以识别各种类型的文字,本部分将演示印刷体、手写体和数学公式,让你快速了解模型的核心功能。
印刷体OCR识别
准备一张要识别的图片,如下:

在页面上点击上传区域,或直接拖拽图片上传:

上传后,点击“开始生成”按钮:

点击开始后,可按快捷键 Ctrl + shift +esc 打开任务管理器,查看GPU负载:

当前RTX 2080 Ti显卡占用达到83%,当占用下降时说明OCR识别完成。返回页面查看:

页面提示“完整下载请去outputs文件夹”,打开项目目录的outputs子目录:

进入后可以看到生成的文件和图片:

通过原图和OCR识别后的图片对比:

基本上没有发现识别错误,完美识别了印刷体图片上的英文内容!
手写体OCR识别
接下来测试手写体图片:

直接展示结果:

可以看到,完美识别了内容,且没有任何错误!
数学公式OCR识别
测试数学公式图片:

效果对比如下:

除了原图中的回车符号显示为句号,以及表格列方向与原图不符外,文字和数学公式完全正确,准确率极高!
下载cpolar内网穿透
我们已经成功启动了PaddleOCR-VL项目,可以通过 http://127.0.0.1:7891/ 这样的地址访问。但这个地址只能在本地设备访问,其他电脑、手机或朋友远程体验时完全打不开。接下来,通过cpolar内网穿透,让PaddleOCR-VL像在线网站一样被外部访问。
什么是cpolar?

cpolar是一款内网穿透工具,可以将局域网内运行的服务通过安全加密的中间隧道映射至公网,让外部设备无需配置路由器即可访问。广泛支持Windows、macOS、Linux、树莓派、群晖NAS等平台,并提供一键安装脚本。
下载cpolar
打开cpolar官网下载页面,点击 立即下载 64-bit 按钮下载安装包:

下载后解压并执行安装程序,一路默认安装。打开cmd窗口输入如下命令确认安装:
cpolar version

出现如上版本即代表安装成功!
注册及登录cpolar Web UI管理界面
访问 cpolar 官网,点击 免费注册 按钮进行注册:

进入注册页面完成注册:

注册完成后,在浏览器中输入如下地址访问Web UI管理界面:
http://127.0.0.1:9200

输入注册账号登录:

穿透PaddleOCR-VL项目以支持公网访问
随机域名方式(免费方案)
随机域名方式适合预算有限的用户,系统会每隔24小时左右自动更换域名地址。对于长期访问不太友好,但该方案免费。如果有一定预算,可以查看 大纲5.2 的固定域名方式,访问更稳定。
点击左侧菜单栏的 隧道管理 ,展开进入 隧道列表 页面,默认有2个隧道:
- remoteDesktop隧道:指向3389端口,tcp协议
- website隧道:指向8080端口,http协议(http协议默认生成http和https两个公网地址)

点击编辑 website 的隧道,修改成 PaddleOCR-VL 需要的信息:

注意:每个用户创建的隧道显示的公网地址都不一样。
接着,点击左侧菜单的 状态 菜单,点击 在线隧道列表 菜单按钮,可以看到2个PaddleOCR-VL-7891隧道,一个为http协议,另一个为https协议:

在浏览器中访问PaddleOCR-VL-7891隧道生成的公网地址(以https为例):

成功访问!
固定域名方式(升级任意套餐皆可)
免费随机域名方案每24小时自动更换域名地址,带来不便。固定域名方案让你拥有一个 永久不变的专属地址 ,实现稳定可靠的OCR在线工作台。
进入官网预留页面:
https://dashboard.cpolar.com/reserved
选择 预留 菜单,看到 保留二级子域名 项,填写 地区 、 名称 、 描述(可不填) ,点击保留:

列表中显示了一条已保留的二级子域名记录:
- 地区:显示为
China Top - 二级域名:显示为
pdocr
接着,进入侧边菜单栏的 隧道管理 下的 隧道列表 ,找到名为 PaddleOCR-VL-7891 的隧道,点击 编辑 按钮进入编辑页面:

修改域名类型为 二级子域名 ,填写配置好的子域名,点击更新:

来到 状态 菜单下的 在线隧道列表 ,可以看到隧道名称为 PaddleOCR-VL-7891 的公网地址已变更为 二级子域名+固定域名主体及后缀 的形式:

以https协议测试访问:

访问成功!这样你就拥有了一个永久不变的专属域名。
为PaddleOCR-VL添加访问授权验证
完成公网部署后,你会发现 PaddleOCR-VL 默认无需登录即可访问。在家庭共享网络或团队协作场景下,可能存在安全隐患。例如,他人可通过公网地址随意提交图片识别任务,甚至查看配置信息,存在滥用资源的风险。
为了保障系统安全,可以借助cpolar内置的访问授权验证功能,为公网隧道添加密码保护。
配置访问授权验证
打开cpolar管理界面,进入 隧道管理 → 隧道列表 ,找到 PaddleOCR-VL-7891 隧道,点击 编辑 按钮:

在编辑页面中,点击 高级 按钮展开高级配置选项,按照下图设置:在HttpAuth栏输入admin:123456,其中admin为账号,123456为密码:

验证授权效果
重新访问公网地址,浏览器会弹出登录验证框:

输入用户名和密码后,即可正常访问PaddleOCR-VL的Web界面。通过这一道简单的验证,你的OCR服务就具备了基础的安全防护。
总结
PaddleOCR-VL这套方案在“自己搭OCR服务”这件事上完成度较高。整合包降低了部署门槛,印刷体和手写体识别效果实测可用,数学公式因结构复杂偶有误差但整体可接受。需要注意的是,它对GPU有一定要求——演示使用RTX 2080 Ti,没有独显的机器会比较吃力。
cpolar在此解决了远程访问通道的问题,但核心能力仍是PaddleOCR-VL本身。这套组合适合对图片文字提取有持续需求且注重隐私的用户。偶尔使用的话付费平台更省事;如果使用频率高,自建服务长期成本更低,也不用担心图片数据外泄。
浙公网安备 33010602011771号