python3配置Pillow、tesseract-ocr与pytesseract模块的图片识别
1.安装Pillow
pip install Pillow
2.安装tesseract-ocr
tesseract是Python的一个OCR(光学字符识别)库
首先下载tesseract的exe安装文件 https://github.com/UB-Mannheim/tesseract/wiki
安装时默认只有一个eng的识别库,可以勾选想要添加的库,或者自己单独下载后放到安装文件夹tessdata下。

双击安装完成后,配置环境变量

配置完成后:
cmd输入命令

输入命令tesseract --list-langs 可以支持的语言:

利用tesseract 将图片转换成文本

若运行时出现如下错误:
D:\Tesseract-OCR\tessdata>tesseract num2.jpg result -l eng Error opening data file F:\Tesseract-OCR\eng.traineddata Please make sure the TESSDATA_PREFIX environment variable is set to your "tessda ta" directory. Failed loading language 'eng' Tesseract couldn't load any languages! Could not initialize tesseract.
1.添加环境变量 TESSDATA_PREFIX -> D:\Tesseract-OCR\tessdata
注:末尾不要加;
2.环境变量path后面追加 D:\Tesseract-OCR;
保存后,重新打开命令提示符窗口,进入图片存放路径,
执行: tesseract num2.jpg result -l eng 或 tesseract C:\Users\Desktop\1.jpg C:\Users\Desktop\2 -l chi_sim即可。
附录:
tessdata 目录存放的是语言字库文件,和在命令行界面中可能用到的参数所对应的文件. 这个安装程序默认包含了英文字库。
如果想能识别中文,可以到http://code.google.com/p/tesseract-ocr/downloads/list下载对应的语言的字库文件.一般google访问不了,请到这里下载即可,
简体中文字库文件下载地址为: http://download.csdn.net/download/wanghui2008123/7621567 下载完成后解压,然后将该文件剪切到tessdata目录下去就可以了(请注意是放到tessdata文件下)。
1. 识别只有字符的图片 tesseract xxx.jpg test ,此时会把图片中的字符全放在test.txt中.
2.识别有汉字的图片 tesseract pytesseract.jpg test -l chi_sim -l chi_sim 表示用简体中文字库(需要下载中文字库文件,解压后,存放到tessdata目录下去,字库文件扩展名为 .raineddata 简体中文字库文件名为: chi_sim.traineddata)
3.想要下载多种识别语言访问:https://github.com/tesseract-ocr/tessdata
3.安装pytesseract
pip install pytesseract
如不能使用pip直接安装可取搜索模块文件直接安装
浙公网安备 33010602011771号