py--re模块
1、根据手机号码一共11位并且是只以13、14、15、18开头的数字这些特点,我们用python写了如下代码:
while True: phone_number = input('please input your phone number : ') if len(phone_number) == 11 \ and phone_number.isdigit()\ and (phone_number.startswith('13') \ or phone_number.startswith('14') \ or phone_number.startswith('15') \ or phone_number.startswith('18')): print('是合法的手机号码') else: print('不是合法的手机号码') 判断手机号码是否合法1
用re模块:
import re phone_number = input('please input your phone number : ') if re.match('^(13|14|15|18)[0-9]{9}$',phone_number): print('是合法的手机号码') else: print('不是合法的手机号码')
正则表达式本身也和python没有什么关系,就是匹配字符串内容的一种规则。
官方定义:正则表达式是对字符串操作的一种逻辑公式,就是用事先定义好的一些特定字符、及这些特定字符的组合,组成一个“规则字符串”,
这个“规则字符串”用来表达对字符串的一种过滤逻辑。
正则表达式
在线测试工具 http://tool.chinaz.com/regex/
首先你要知道的是,谈到正则,就只和字符串相关了。在我给你提供的工具中,你输入的每一个字都是一个字符串。
其次,如果在一个位置的一个值,不会出现什么变化,那么是不需要规则的。
比如你要用"1"去匹配"1",或者用"2"去匹配"2",直接就可以匹配上。这连python的字符串操作都可以轻松做到。
那么在之后我们更多要考虑的是在同一个位置上可以出现的字符的范围。
| 正则 | 待匹配字符 | 匹配结果 | 说明 |
| [0123456789] | 5 | True |
在一个字符组里枚举合法的所有字符,字符组里的任意一个字符 |
[0123456789] |
a | False |
由于字符组中没有"a"字符,所以不能匹配 |
| [0-9] | 7 | True |
也可以用-表示范围,[0-9]就和[0123456789]是一个意思 |
| [a--z] | s | True |
同样的如果要匹配所有的小写字母,直接用[a-z]就可以表示 |
| [A-Z] | B | True |
[A-Z]就表示所有的大写字母 |
| [0-9a-zA-Z] | e | True |
可以匹配数字,大小写形式的a~f,用来验证十六进制字符 |
字符:
元字符 |
匹配内容 |
| . | 匹配除换行符以外的任意字符 |
| \w | 匹配字母或数字或下划线 |
| \s | 匹配任意的空白符 |
| \d | 匹配数字 |
| \n | 匹配一个换行符 |
| \t | 匹配一个制表符 |
| \b | 匹配一个单词的结尾 |
| ^ | 匹配字符串的开始 |
| $ | 匹配字符串的结尾 |
| \W |
匹配非字母或数字或下划线 |
| \D |
匹配非数字 |
| \S |
匹配非空白符 |
| a|b |
匹配字符a或字符b |
| () |
匹配括号内的表达式,也表示一个组 |
| [...] |
匹配字符组中的字符 |
| [^...] |
匹配除了字符组中字符的所有字符 |
量词:
量词 |
用法说明 |
| * | 重复零次或更多次 |
| + | 重复一次或更多次 |
| ? | 重复零次或一次 |
| {n} | 重复n次 |
| {n,} | 重复n次或更多次 |
| {n,m} | 重复n到m次 |
2、. ^ $
| 正则 | 待匹配字符 | 匹配 结果 |
说明 |
| 海. | 海燕海娇海东 | 海燕海娇海东 | 匹配所有"海."的字符 |
| ^海. | 海燕海娇海东 | 海燕 | 只从开头匹配"海." |
| 海.$ | 海燕海娇海东 | 海东 | 只匹配结尾的"海.$" |
3、* + ? { }
| 正则 | 待匹配字符 | 匹配 结果 |
说明 |
| 李.? | 李杰和李莲英和李二棍子 |
李杰 |
?表示重复零次或一次,即只匹配"李"后面一个任意字符 |
| 李.* | 李杰和李莲英和李二棍子 | 李杰和李莲英和李二棍子 |
*表示重复零次或多次,即匹配"李"后面0或多个任意字符 |
| 李.+ | 李杰和李莲英和李二棍子 | 李杰和李莲英和李二棍子 |
+表示重复一次或多次,即只匹配"李"后面1个或多个任意字符 |
| 李.{1,2} | 李杰和李莲英和李二棍子 |
李杰和 |
{1,2}匹配1到2次任意字符
|
注意:前面的*,+,?等都是贪婪匹配,也就是尽可能匹配,后面加?号使其变成惰性匹配
4、字符集[][^]
| 正则 | 待匹配字符 | 匹配 结果 |
说明 |
| 李[杰莲英二棍子]* | 李杰和李莲英和李二棍子 |
李杰 |
表示匹配"李"字后面[杰莲英二棍子]的字符任意次 |
| 李[^和]* | 李杰和李莲英和李二棍子 |
李杰 |
表示匹配一个不是"和"的字符任意次 |
| [\d] | 456bdha3 |
4 |
表示匹配任意一个数字,匹配到4个结果 |
| [\d]+ | 456bdha3 |
456 |
表示匹配任意个数字,匹配到2个结果 |
5、分组 ()与 或 |[^]
身份证号码是一个长度为15或18个字符的字符串,如果是15位则全部🈶️数字组成,首位不能为0;如果是18位,则前17位全部是数字,末位可能是数字或x,下面我们尝试用正则来表示:
| 正则 | 待匹配字符 | 匹配 结果 |
说明 |
| ^[1-9]\d{13,16}[0-9x]$ | 110101198001017032 |
110101198001017032 |
表示可以匹配一个正确的身份证号 |
| ^[1-9]\d{13,16}[0-9x]$ | 1101011980010170 |
1101011980010170 |
表示也可以匹配这串数字,但这并不是一个正确的身份证号码,它是一个16位的数字 |
| ^[1-9]\d{14}(\d{2}[0-9x])?$ | 1101011980010170 |
False |
现在不会匹配错误的身份证号了 |
| ^([1-9]\d{16}[0-9x]|[1-9]\d{14})$ | 110105199812067023 |
110105199812067023 |
表示先匹配[1-9]\d{16}[0-9x]如果没有匹配上就匹配[1-9]\d{14}
|
6、转义符 \
在正则表达式中,有很多有特殊意义的是元字符,比如\d和\s等,如果要在正则中匹配正常的"\d"而不是"数字"就需要对"\"进行转义,变成'\\'。
在python中,无论是正则表达式,还是待匹配的内容,都是以字符串的形式出现的,在字符串中\也有特殊的含义,本身还需要转义。所以如果匹配一次"\d",字符串中要写成'\\d',那么正则里就要写成"\\\\d",这样就太麻烦了。这个时候我们就用到了r'\d'这个概念,此时的正则是r'\\d'就可以了。
| 正则 | 待匹配字符 | 匹配 结果 |
说明 |
| \d | \d | False |
因为在正则表达式中\是有特殊意义的字符,所以要匹配\d本身,用表达式\d无法匹配 |
| \\d | \d | True |
转义\之后变成\\,即可匹配 |
| "\\\\d" | '\\d' | True |
如果在python中,字符串中的'\'也需要转义,所以每一个字符串'\'又需要转义一次 |
| r'\\d' | r'\d' | True |
在字符串之前加r,让整个字符串不转义 |
7、贪婪匹配
贪婪匹配:在满足匹配时,匹配尽可能长的字符串,默认情况下,采用贪婪匹配
| 正则 | 待匹配字符 | 匹配 结果 |
说明 |
| <.*> |
<script>...<script> |
<script>...<script> |
默认为贪婪匹配模式,会匹配尽量长的字符串 |
| <.*?> | r'\d' |
<script> |
加上?为将贪婪匹配模式转为非贪婪匹配模式,会匹配尽量短的字符串 |
几个常用的非贪婪匹配Pattern:
*? 重复任意次,但尽可能少重复 +? 重复1次或更多次,但尽可能少重复 ?? 重复0次或1次,但尽可能少重复 {n,m}? 重复n到m次,但尽可能少重复 {n,}? 重复n次以上,但尽可能少重复
.*?的用法
. 是任意字符 * 是取 0 至 无限长度 ? 是非贪婪模式。 何在一起就是 取尽量少的任意字符,一般不会这么单独写,他大多用在: .*?x 就是取前面任意长度的字符,直到一个x出现
总结:
# 正则表达式 字符串的操作 # 使用一些规则来检测字符串是否符合我的要求 —— 表单验证 # 从一段字符串中找到符合我要求的内容 —— 爬虫 # 完全相等的字符串都可以匹配上 == # 字符组 字符组代表一个字符位置上可以出现的所有内容 # 范围 : # 根据asc码来的,范围必须是从小到大的指向 # 一个字符组中可以有多个范围 # 如果两个正则表达式之间用"或"连接,且有一部分正则规则相同, # 那么一定要把规则长的放在前面 # 如果对一组正则表达式整体有一个量词约束,就将这一组表达式分成一个组 # 在组外进行量词约束
8、re模块下的常用方法:
import re ret = re.findall('a', 'eva egon yuan') # 返回所有满足匹配条件的结果,放在列表里 print(ret) #结果 : ['a', 'a'] ret = re.search('a', 'eva egon yuan').group() print(ret) #结果 : 'a' # 函数会在字符串内查找模式匹配,只到找到第一个匹配然后返回一个包含匹配信息的对象,该对象可以 # 通过调用group()方法得到匹配的字符串,如果字符串没有匹配,则返回None。 ret = re.match('a', 'abc').group() # 同search,不过尽在字符串开始处进行匹配 print(ret) #结果 : 'a' ret = re.split('[ab]', 'abcd') # 先按'a'分割得到''和'bcd',在对''和'bcd'分别按'b'分割 print(ret) # ['', '', 'cd'] ret = re.sub('\d', 'H', 'eva3egon4yuan4', 1)#将数字替换成'H',参数1表示只替换1个 print(ret) #evaHegon4yuan4 ret = re.subn('\d', 'H', 'eva3egon4yuan4')#将数字替换成'H',返回元组(替换的结果,替换了多少次) print(ret) obj = re.compile('\d{3}') #将正则表达式编译成为一个 正则表达式对象,规则要匹配的是3个数字 ret = obj.search('abc123eeee') #正则表达式对象调用search,参数为待匹配的字符串 print(ret.group()) #结果 : 123 import re ret = re.finditer('\d', 'ds3sy4784a') #finditer返回一个存放匹配结果的迭代器 print(ret) # <callable_iterator object at 0x10195f940> print(next(ret).group()) #查看第一个结果 print(next(ret).group()) #查看第二个结果 print([i.group() for i in ret]) #查看剩余的左右结果
这是老师总结的。
我的总结:
1、re.findall
# findall接收两个参数 : 正则表达式 要匹配的字符串
# 一个列表数据类型的返回值:所有和这条正则匹配的结果
1、 import re ret=re.findall('l','luhan,lll,akakl') print(ret) #['l', 'l', 'l', 'l', 'l'] 2、 import re ret=re.findall('\d+','92lwljsie9292') print(ret) #['92', '9292'] 3、re.findall()有关的例子:查找一个文件夹里边的电话号 with open('ax','r',encoding='utf-8') as f: l=[] for i in f: ret=re.findall('1[3-9]\d{9}',i) l.extend(ret) print(l) #['17839948653', '16601162643', '18929283939']
2、re.search
1、 import re ret=re.search('uuuu','usuuslsluuuu') print(ret) #<_sre.SRE_Match object; span=(0, 1), match='u'> # 如果匹配到了,返回一个结果对象 # 如果没匹配到,返回一个None if ret: print(ret.group()) #uuuu r如果没有则返回的是None
3、re.match
import re ret=re.match('al','alalalallajdjjdjd') if ret: print(ret.group()) #al
re.findall、re.search、re.match这三个的总结:
1、findall接收两个参数 : 正则表达式 要匹配的字符串。
一个列表数据类型的返回值:所有和这条正则匹配的结果
2、search和findall的区别:
1.search找到一个就返回,findall是找所有
2.findall是直接返回一个结果的列表,search返回一个对象
3、match
# ·1 意味着在正则表达式中添加了一个^
# ·2 和search一样 匹配返回结果对象 没匹配到返回None
# ·3 和search一样 从结果中获取值 仍然用group
4、re.subn 替换
import re ret=re.subn('\d','H','kslsi29jjd') print(ret) #('kslsiHHjjd', 2) # #将数字替换成'H',返回元组(替换的结果,替换了多少次)
5、re.compile 编译
import re obj=re.compile('\d+') # 编译 在多次执行同一条正则规则的时候才适用 ret1=obj.findall('282jks92111jdj') ret2=obj.search('jajaj9292ksnnvdl2') print(ret2.group()) print(ret1) # 9292 # ['282', '92111']
# 正则表达式 -->根据规则匹配字符串 # 从一个字符串中找到符合规则的字符串 --> python # 正则规则 -编译-> python能理解的语言 # 多次执行,就需要多次编译 浪费时间 re.findall('1[3-9]\d{9}',line) # 编译 re.compile('\d{3}')
6、re.finditer
import re ret=re.finditer('\d','jd8sk3sks3222s')#finditer适用于结果比较多的情况下,能够有效的节省内存 print(ret)#<callable_iterator object at 0x000001B5BA5BE7B8> # print(ret.__next__().group()) #8 # for i in ret: # print(i.group()) #8 print(next(ret).group()) #查看第一个结果 print(next(ret).group()) #查看第二个结果 print([i.group() for i in ret]) #查看剩余的左右结果 # 8 # 3 # ['3', '2', '2', '2']
7、1 findall的优先级查询:
# 当分组遇到re模块 import re ret1 = re.findall('www.(baidu|oldboy).com', 'www.oldboy.com') ret2 = re.findall('www.(?:baidu|oldboy).com', 'www.baidu.com') print(ret1) print(ret2) # ['oldboy'] # ['www.baidu.com'] # findall会优先显示组内匹配到的内容,如果想取消分组优先效果,在组内开始的时候加上?:
2 split的优先级查询
import re ret=re.split("\d+","eva3egon4yuan") print(ret) #结果 : ['eva', 'egon', 'yuan'] ret=re.split("(\d+)","eva162784673egon44yuan") print(ret) #结果 : ['eva', '162784673', 'egon', '44', 'yuan'] # split分割一个字符串,默认被匹配到的分隔符不会出现在结果列表中, # 如果将匹配的正则放到组内,就会将分隔符放到结果列表里
#分组的意义
# 1.对一组正则规则进行量词约束
# 2.从一整条正则规则匹配的结果中优先显示组内的内容
"<h1>hello</h1>" import re ret = re.findall('<\w+>(\w+)</\w+>',"<h1>hello</h1>") print(ret) #['hello']
# 分组命名 import re ret = re.search("<(?P<tag>\w+)>(?P<content>\w+)</(?P=tag)>","<h1>hello</h1>") print(ret) print(ret.group()) # search中没有分组优先的概念<h1>hello</h1> print(ret.group('tag'))#h1 print(ret.group('content'))#hello ret = re.search(r"<(\w+)>(\w+)</\1>", "<h1>hello</h1>") #如果不给组起名字,也可以用\序号来找到对应的组,表示要找的内容和前面的组内容一致 # #获取的匹配结果可以直接用group(序号)拿到对应的值 print(ret.group()) print(ret.group(0)) #结果 :<h1>hello</h1> print(ret.group(1)) #结果 :h1 print(ret.group(2)) #结果 :hello

浙公网安备 33010602011771号