扫描件转可搜索 PDF:OCR 的识别率取决于什么
扫描件转可搜索 PDF:OCR 的识别率取决于什么
很多扫描件PDF 看着清楚,但它是「一张图片装在 PDF 里」,没有任何文字信息。
顺序可以按自己的习惯调,我按最常用的排。
先分清两种 PDF
文字型 PDF:能选中、能搜索,占用小。
扫描型 PDF:本质是图片,文字只是长得像。判断方法:试着选中一段文字,能选中就是文字型。
你需要的是把扫描型转成文字型。
识别率取决于什么
分辨率:150 DPI 勉强能用,300 DPI 是标准,400 以上收益递减。
拍摄角度:倾斜 10 度,识别率就明显下降。扫描仪比手机强。
对比度与阴影:手影、反光会让局部识别失败。
版面复杂度:表格、印章、手写签名会拉低识别率,尤其印章盖住文字时。
识别后的清理
OCR 出来的 PDF 常有多余空白页、断行错误、页码错乱。
关键是扁平化(flatten):把识别出的文字层和原图合成一层,避免打印时重复显示。
# 合并图层(Ghostscript)
gs -sDEVICE=pdfwrite -dNOPAUSE -dQUIET \
-dAutoRotatePages=/None -sOutputFile=flat.pdf in.pdf
处理完加批注、签字就方便了,不会因为图层问题显示异常。
一点说明
以上是我自己流程里的做法,不一定适合所有人。如果你的场景有更好的顺序,欢迎在评论区补充。
延伸阅读
这类操作在多个工具里都有对应实现,可以按自己的技术栈选一个,重点是确认处理过程在本地完成、文件不出本机。
浙公网安备 33010602011771号