一些常用的正则表达式

[日期：2015-09-15]

来源：Linux社区作者：Linux

[字体：大中小]

正则表达式用于字符串处理、表单验证等场合，实用高效。但用到时总是不太把握，以致往往要查证一番。现将一些常用的表达式收集于此，以备不时之需。

1.匹配中文字符的正则表达式： [\u4e00-\u9fa5]
2.评注：匹配中文还真是个头疼的事，有了这个表达式就好办了
3.匹配双字节字符(包括汉字在内)：[^\x00-\xff]
4.评注：可以用来计算字符串的长度（一个双字节字符长度计2，ASCII字符计1）
5.匹配空白行的正则表达式：\n\s*\r
6.评注：可以用来删除空白行
7.匹配HTML标记的正则表达式：< (\S*?)[^>]*>.*?|< .*? />
8.评注：网上流传的版本太糟糕，上面这个也仅仅能匹配部分，对于复杂的嵌套标记依旧无能为力
9.匹配首尾空白字符的正则表达式：^\s*|\s*$
10.评注：可以用来删除行首行尾的空白字符(包括空格、制表符、换页符等等)，非常有用的表达式
11.匹配Email地址的正则表达式：\w+([-+.]\w+)*@\w+([-.]\w+)*\.\w+([-.]\w+)*
12.
13.评注：表单验证时很实用
14.匹配网址URL的正则表达式：[a-zA-z]+://[^\s]*
15.评注：网上流传的版本功能很有限，上面这个基本可以满足需求
16.匹配帐号是否合法(字母开头，允许5-16字节，允许字母数字下划线)：^[a-zA-Z][a-zA-Z0-9_]{4,15}$
17.评注：表单验证时很实用
18.匹配国内电话号码：\d{3}-\d{8}|\d{4}-\d{7}
19.评注：匹配形式如 0511-4405222 或 021-87888822
20.匹配腾讯QQ号：[1-9][0-9]{4,}
21.评注：腾讯QQ号从10000开始
22.匹配中国邮政编码：[1-9]\d{5}(?!\d)
23.评注：中国邮政编码为6位数字
24.匹配身份证：\d{15}|\d{18}
25.评注：中国的身份证为15位或18位
26.匹配ip地址：\d+\.\d+\.\d+\.\d+
27.评注：提取ip地址时有用
28.匹配特定数字：
29.^[1-9]\d*$ //匹配正整数
30.^-[1-9]\d*$ //匹配负整数
31.^-?[1-9]\d*$ //匹配整数
32.^[1-9]\d*|0$ //匹配非负整数（正整数 + 0）
33.^-[1-9]\d*|0$ //匹配非正整数（负整数 + 0）
34.^[1-9]\d*\.\d*|0\.\d*[1-9]\d*$ //匹配正浮点数
35.^-([1-9]\d*\.\d*|0\.\d*[1-9]\d*)$ //匹配负浮点数
36.^-?([1-9]\d*\.\d*|0\.\d*[1-9]\d*|0?\.0+|0)$ //匹配浮点数
37.^[1-9]\d*\.\d*|0\.\d*[1-9]\d*|0?\.0+|0$ //匹配非负浮点数（正浮点数 + 0）
38.^(-([1-9]\d*\.\d*|0\.\d*[1-9]\d*))|0?\.0+|0$ //匹配非正浮点数（负浮点数 + 0）
39.评注：处理大量数据时有用，具体应用时注意修正
40.匹配特定字符串：
41.^[A-Za-z]+$ //匹配由26个英文字母组成的字符串
42.^[A-Z]+$ //匹配由26个英文字母的大写组成的字符串
43.^[a-z]+$ //匹配由26个英文字母的小写组成的字符串
44.^[A-Za-z0-9]+$ //匹配由数字和26个英文字母组成的字符串
45.^\w+$ //匹配由数字、26个英文字母或者下划线组成的字符串

评注：最基本也是最常用的一些表达式。

Linux 基础入门教程----正则表达式基础 http://www.linuxidc.com/Linux/2015-08/121441.htm

Linux正则表达式sed 详述 http://www.linuxidc.com/Linux/2015-04/116309.htm

Linux正则表达式特性及BRE与ERE的区别 http://www.linuxidc.com/Linux/2014-03/99152.htm

grep使用简明及正则表达式 http://www.linuxidc.com/Linux/2013-08/88534.htm

正则表达式的用法 http://www.linuxidc.com/Linux/2013-03/81897.htm

正则表达式之零宽断言 http://www.linuxidc.com/Linux/2013-03/81897.htm

Linux中正则表达式与文件格式化处理命令(awk/grep/sed) http://www.linuxidc.com/Linux/2013-03/81018.htm

基础正则表达式 http://www.linuxidc.com/Linux/2014-09/106296.htm

常用正则表达式整理 http://www.linuxidc.com/Linux/2014-10/108076.htm

本文永久更新链接地址：http://www.linuxidc.com/Linux/2015-09/123065.htm

http://www.linuxidc.com/Linux/2015-09/123065.htm

################################################################################################################################################

正则表达式的用法

[日期：2013-03-29]

来源：Linux社区作者：Linux

[字体：大中小]

正则表达式的作用主要有三：

验证数字是否符合特定模式；
利用正则表达式找到特定文本而后删除或者替换文本；
按模式匹配在字符串中查找查找匹配子字符串。

正则表达式就是有普通字符以及特殊字符（称为元字符）组成的文字模式。元字符前面的字符称为前导符，元字符按功能又分为限定符、定位符等类别，下面对常用的元字符进行列表说明。

常见元字符

说明

\s 匹配单个空格，包括tab键和换行符

\S 匹配出单个空格符之外的所有字符，\S与\s互为逆运算

\d 匹配从0～9的数字

\w 匹配字母，数字或者下划线字符

\W 匹配所有与\w不匹配的字符，\W与\s互为逆运算

\cx 匹配由x指明的控制字符。

\f 匹配一个换页符，等价与\x0c和\cL

\n 匹配一个换行符，等价于\x0a和\cJ

\r 匹配一个回车符，等价于\x0d和\cM

\t 匹配一个制表符，等价于\x09和\cI

\v 匹配一个垂直制表符。等价于\x0b和\cK

. 用于匹配除换行符之外的所有字符

常见限定符说明

* 匹配前导字符出现零次或者多次

+ 匹配前导字符出现一次或者多次

? 匹配前导字符出现零次或者一次

{n} 匹配前导字符出现n次,n>=0;

{n,} 匹配前导字符至少出现n次,n>=0;

{n,m} 匹配前导字符至少出现n次，最多出现m次;m>n>=0;

定位符说明

^ 匹配模式必须出现在目标字符串开头

$ 匹配模式必须出现在目标的结尾

\b 匹配模式必须出现在目标字符串的开头或者结尾的两个边界之一

\B 匹配对象必须位于目标字符串的开头和结尾的两个边界之内，即匹配对象既不能作为目标字符串的开头，也不能作为目标字符串的结尾

正则表达式匹配模式的范围指定符

[] 限定的模式指定了其中一个字符的出现的可能。如/[A-Z]/表示匹配从A到Z任何一个字符；

() 限定的模式指定()里包含的内容必须同时出现在对象中。如/(abc)[0-9]/意思是目标字符串中出现的abc1,abc2...abc9中9个中的任何一个，而不是ab1,a2等；

| 类似于逻辑运算中的“或”运算，如：/sb|a/表示与目标对象的"sb","a"中任何一个相匹配；

当^符出现在[]中时，表示取否定运算。

字符转义与优先级顺序

在匹配模式需要使用元字符时，需要使用转移字符“\+元字符”表示，如查找“12*”模式，我们可以使用/12\*/表示；

正则表达式在匹配过程中是按照从左向右的顺序进行的，其操作符具有一定的优先级顺序

优先级顺序

优先级操作符说明

1 \ 转义符

2 (),(?:),(?=),[] 圆括号和方括号

3 *,+,?,{n},{n,},{n,m} 限定符

4 ^,$,\anyMatchcharacter 位置顺序

5 | 或操作

http://www.linuxidc.com/Linux/2013-03/81897.htm

posted @ 2016-03-18 14:24 a318013800 阅读(184) 评论(0) 收藏举报

刷新页面返回顶部

一些常用的正则表达式

正则表达式的用法

公告