一些常用的正则表达式

 

[日期:2015-09-15] 来源:Linux社区  作者:Linux [字体:  ]
 
 
 

正则表达式用于字符串处理、表单验证等场合,实用高效。但用到时总是不太把握,以致往往要查证一番。现将一些常用的表达式收集于此,以备不时之需。

1.匹配中文字符的正则表达式: [\u4e00-\u9fa5]
2.评注:匹配中文还真是个头疼的事,有了这个表达式就好办了
3.匹配双字节字符(包括汉字在内):[^\x00-\xff]
4.评注:可以用来计算字符串的长度(一个双字节字符长度计2,ASCII字符计1)
5.匹配空白行的正则表达式:\n\s*\r
6.评注:可以用来删除空白行
7.匹配HTML标记的正则表达式:< (\S*?)[^>]*>.*?|< .*? />
8.评注:网上流传的版本太糟糕,上面这个也仅仅能匹配部分,对于复杂的嵌套标记依旧无能为力
9.匹配首尾空白字符的正则表达式:^\s*|\s*$
10.评注:可以用来删除行首行尾的空白字符(包括空格、制表符、换页符等等),非常有用的表达式
11.匹配Email地址的正则表达式:\w+([-+.]\w+)*@\w+([-.]\w+)*\.\w+([-.]\w+)*
12.
13.评注:表单验证时很实用
14.匹配网址URL的正则表达式:[a-zA-z]+://[^\s]*
15.评注:网上流传的版本功能很有限,上面这个基本可以满足需求
16.匹配帐号是否合法(字母开头,允许5-16字节,允许字母数字下划线):^[a-zA-Z][a-zA-Z0-9_]{4,15}$
17.评注:表单验证时很实用
18.匹配国内电话号码:\d{3}-\d{8}|\d{4}-\d{7}
19.评注:匹配形式如 0511-4405222 或 021-87888822
20.匹配腾讯QQ号:[1-9][0-9]{4,}
21.评注:腾讯QQ号从10000开始
22.匹配中国邮政编码:[1-9]\d{5}(?!\d)
23.评注:中国邮政编码为6位数字
24.匹配身份证:\d{15}|\d{18}
25.评注:中国的身份证为15位或18位
26.匹配ip地址:\d+\.\d+\.\d+\.\d+
27.评注:提取ip地址时有用
28.匹配特定数字:
29.^[1-9]\d*$ //匹配正整数
30.^-[1-9]\d*$ //匹配负整数
31.^-?[1-9]\d*$ //匹配整数
32.^[1-9]\d*|0$ //匹配非负整数(正整数 + 0)
33.^-[1-9]\d*|0$ //匹配非正整数(负整数 + 0)
34.^[1-9]\d*\.\d*|0\.\d*[1-9]\d*$ //匹配正浮点数
35.^-([1-9]\d*\.\d*|0\.\d*[1-9]\d*)$ //匹配负浮点数
36.^-?([1-9]\d*\.\d*|0\.\d*[1-9]\d*|0?\.0+|0)$ //匹配浮点数
37.^[1-9]\d*\.\d*|0\.\d*[1-9]\d*|0?\.0+|0$ //匹配非负浮点数(正浮点数 + 0)
38.^(-([1-9]\d*\.\d*|0\.\d*[1-9]\d*))|0?\.0+|0$ //匹配非正浮点数(负浮点数 + 0)
39.评注:处理大量数据时有用,具体应用时注意修正
40.匹配特定字符串:
41.^[A-Za-z]+$ //匹配由26个英文字母组成的字符串
42.^[A-Z]+$ //匹配由26个英文字母的大写组成的字符串
43.^[a-z]+$ //匹配由26个英文字母的小写组成的字符串
44.^[A-Za-z0-9]+$ //匹配由数字和26个英文字母组成的字符串
45.^\w+$ //匹配由数字、26个英文字母或者下划线组成的字符串

评注:最基本也是最常用的一些表达式。

Linux 基础入门教程----正则表达式基础   http://www.linuxidc.com/Linux/2015-08/121441.htm

Linux正则表达式sed 详述  http://www.linuxidc.com/Linux/2015-04/116309.htm

Linux正则表达式特性及BRE与ERE的区别 http://www.linuxidc.com/Linux/2014-03/99152.htm

grep使用简明及正则表达式 http://www.linuxidc.com/Linux/2013-08/88534.htm

正则表达式的用法 http://www.linuxidc.com/Linux/2013-03/81897.htm

正则表达式之零宽断言 http://www.linuxidc.com/Linux/2013-03/81897.htm

Linux中正则表达式与文件格式化处理命令(awk/grep/sed) http://www.linuxidc.com/Linux/2013-03/81018.htm

基础正则表达式 http://www.linuxidc.com/Linux/2014-09/106296.htm

常用正则表达式整理 http://www.linuxidc.com/Linux/2014-10/108076.htm

本文永久更新链接地址http://www.linuxidc.com/Linux/2015-09/123065.htm

 

http://www.linuxidc.com/Linux/2015-09/123065.htm

 

 

################################################################################################################################################

正则表达式的用法

[日期:2013-03-29] 来源:Linux社区  作者:Linux [字体:  ]
 

正则表达式的作用主要有三:

  • 验证数字是否符合特定模式;
  • 利用正则表达式找到特定文本而后删除或者替换文本;
  • 按模式匹配在字符串中查找查找匹配子字符串。

正则表达式就是有普通字符以及特殊字符(称为元字符)组成的文字模式。元字符前面的字符称为前导符,元字符按功能又分为限定符、定位符等类别,下面对常用的元字符进行列表说明。

常见元字符

说明

\s 匹配单个空格,包括tab键和换行符

\S 匹配出单个空格符之外的所有字符,\S与\s互为逆运算

\d 匹配从0~9的数字

\w 匹配字母,数字或者下划线字符

\W 匹配所有与\w不匹配的字符,\W与\s互为逆运算

\cx 匹配由x指明的控制字符。
 
\f 匹配一个换页符,等价与\x0c和\cL

\n 匹配一个换行符,等价于\x0a和\cJ

\r 匹配一个回车符,等价于\x0d和\cM

\t 匹配一个制表符,等价于\x09和\cI

\v 匹配一个垂直制表符。等价于\x0b和\cK

. 用于匹配除换行符之外的所有字符

常见限定符说明

* 匹配前导字符出现零次或者多次

+ 匹配前导字符出现一次或者多次

? 匹配前导字符出现零次或者一次

{n} 匹配前导字符出现n次,n>=0;

{n,} 匹配前导字符至少出现n次,n>=0;

{n,m} 匹配前导字符至少出现n次,最多出现m次;m>n>=0;

定位符说明

^ 匹配模式必须出现在目标字符串开头

$ 匹配模式必须出现在目标的结尾

\b 匹配模式必须出现在目标字符串的开头或者结尾的两个边界之一

\B 匹配对象必须位于目标字符串的开头和结尾的两个边界之内,即匹配对象既不能作为目标字符串的开头,也不能作为目标字符串的结尾

正则表达式匹配模式的范围指定符

[] 限定的模式指定了其中一个字符的出现的可能。如/[A-Z]/表示匹配从A到Z任何一个字符;

() 限定的模式指定()里包含的内容必须同时出现在对象中。如/(abc)[0-9]/意思是目标字符串中出现的abc1,abc2...abc9中9个中的任何一个,而不是ab1,a2等;

| 类似于逻辑运算中的“或”运算,如:/sb|a/表示与目标对象的"sb","a"中任何一个相匹配;

当^符出现在[]中时,表示取否定运算。
 
字符转义与优先级顺序

在匹配模式需要使用元字符时,需要使用转移字符“\+元字符”表示,如查找“12*”模式,我们可以使用/12\*/表示;
 
正则表达式在匹配过程中是按照从左向右的顺序进行的,其操作符具有一定的优先级顺序
 
 
优先级顺序

优先级  操作符                      说明

1      \                            转义符

2    (),(?:),(?=),[]              圆括号和方括号

3    *,+,?,{n},{n,},{n,m}          限定符

4    ^,$,\anyMatchcharacter        位置顺序

5      |                            或操作

 

http://www.linuxidc.com/Linux/2013-03/81897.htm

posted @ 2016-03-18 14:24  a318013800  阅读(165)  评论(0编辑  收藏  举报