python3配置Pillow、tesseract-ocr与pytesseract模块的图片识别

1.安装Pillow

pip install Pillow

2.安装tesseract-ocr

tesseract是Python的一个OCR(光学字符识别)库

首先下载tesseract的exe安装文件   https://github.com/UB-Mannheim/tesseract/wiki

安装时默认只有一个eng的识别库,可以勾选想要添加的库,或者自己单独下载后放到安装文件夹tessdata下。

双击安装完成后,配置环境变量

配置完成后:

cmd输入命令

 

输入命令tesseract  --list-langs 可以支持的语言:

 利用tesseract 将图片转换成文本

若运行时出现如下错误:

D:\Tesseract-OCR\tessdata>tesseract num2.jpg result -l eng 
Error opening data file F:\Tesseract-OCR\eng.traineddata 
Please make sure the TESSDATA_PREFIX environment variable is set to your "tessda 
ta" directory. 
Failed loading language 'eng' 
Tesseract couldn't load any languages! 
Could not initialize tesseract. 

1.添加环境变量 TESSDATA_PREFIX  ->  D:\Tesseract-OCR\tessdata   
注:末尾不要加; 
2.环境变量path后面追加 D:\Tesseract-OCR; 
保存后,重新打开命令提示符窗口,进入图片存放路径, 
执行: tesseract num2.jpg result -l eng  或 tesseract C:\Users\Desktop\1.jpg C:\Users\Desktop\2 -l chi_sim即可。

附录:

  tessdata 目录存放的是语言字库文件,和在命令行界面中可能用到的参数所对应的文件. 这个安装程序默认包含了英文字库。

  如果想能识别中文,可以到http://code.google.com/p/tesseract-ocr/downloads/list下载对应的语言的字库文件.一般google访问不了,请到这里下载即可,

  简体中文字库文件下载地址为: http://download.csdn.net/download/wanghui2008123/7621567 下载完成后解压,然后将该文件剪切到tessdata目录下去就可以了(请注意是放到tessdata文件下)。

  1. 识别只有字符的图片 tesseract xxx.jpg test ,此时会把图片中的字符全放在test.txt中.

  2.识别有汉字的图片 tesseract pytesseract.jpg test -l chi_sim -l chi_sim 表示用简体中文字库(需要下载中文字库文件,解压后,存放到tessdata目录下去,字库文件扩展名为 .raineddata 简体中文字库文件名为: chi_sim.traineddata)

  3.想要下载多种识别语言访问:https://github.com/tesseract-ocr/tessdata

3.安装pytesseract

pip install pytesseract

如不能使用pip直接安装可取搜索模块文件直接安装

 

posted @ 2019-02-16 14:02  pathbreaker  阅读(368)  评论(0)    收藏  举报