正则表达式

最新推荐文章于 2022-09-01 08:29:07 发布

Iliuhu

最新推荐文章于 2022-09-01 08:29:07 发布

阅读量134

点赞数

分类专栏： JAVA 文章标签：正则表达式

本文链接：https://blog.csdn.net/liu_to_liu/article/details/117595630

版权

JAVA 专栏收录该内容

14 篇文章 0 订阅

订阅专栏

正则表达式

1、正则表达式
2、最常用的正则表示式

1、正则表达式

1.1 正则表达式基础知识

元字符	描述
`\`	将下一个字符标记符、或一个向后引用、或一个八进制转义符。例如，“\n”匹配\n。“\n”匹配换行符。序列“\”匹配“\”而“(”则匹配“(”。即相当于多种编程语言中都有的“转义字符”的概念。
`^`	匹配输入字行首。如果设置了RegExp对象的Multiline属性，^也匹配“\n”或“\r”之后的位置。
`$`	匹配输入行尾。如果设置了RegExp对象的Multiline属性，$也匹配“\n”或“\r”之前的位置。
`*`	匹配前面的子表达式任意次。例如，zo能匹配“z”，也能匹配“zo”以及“zoo”。等价于{0,}。
`+`	匹配前面的子表达式一次或多次(大于等于1次）。例如，“zo+”能匹配“zo”以及“zoo”，但不能匹配“z”。+等价于{1,}。
`?`	匹配前面的子表达式零次或一次。例如，“do(es)?”可以匹配“do”或“does”。?等价于{0,1}。
`{n}`	n是一个非负整数。匹配确定的n次。例如，“o{2}”不能匹配“Bob”中的“o”，但是能匹配“food”中的两个o。
`{n,}`	n是一个非负整数。至少匹配n次。例如，“o{2,}”不能匹配“Bob”中的“o”，但能匹配“foooood”中的所有o。“o{1,}”等价于“o+”。“o{0,}”则等价于“o*”。
`{n,m}`	m和n均为非负整数，其中n<=m。最少匹配n次且最多匹配m次。例如，“o{1,3}”将匹配“fooooood”中的前三个o为一组，后三个o为一组。“o{0,1}”等价于“o?”。请注意在逗号和两个数之间不能有空格。
`?`	当该字符紧跟在任何一个其他限制符（*,+,?，{n}，{n,}，{n,m}）后面时，匹配模式是非贪婪的。非贪婪模式尽可能少地匹配所搜索的字符串，而默认的贪婪模式则尽可能多地匹配所搜索的字符串。例如，对于字符串“oooo”，“o+”将尽可能多地匹配“o”，得到结果[“oooo”]，而“o+?”将尽可能少地匹配“o”，得到结果 [‘o’, ‘o’, ‘o’, ‘o’]
`.`	匹配除“\n”和"\r"之外的任何单个字符。要匹配包括“\n”和"\r"在内的任何字符，请使用像“[\s\S]”的模式。
`(pattern)`	匹配pattern并获取这一匹配。所获取的匹配可以从产生的Matches集合得到，在VBScript中使用SubMatches集合，在JScript中则使用$0…$9属性。要匹配圆括号字符，请使用“”或“”或“”。
`(?:pattern)`	非获取匹配，匹配pattern但不获取匹配结果，不进行存储供以后使用。这在使用或字符“(\|)”来组合一个模式的各个部分时很有用。例如“industr(?:y\|ies)”就是一个比“industry\|industries”更简略的表达式。
`(?=pattern)`	非获取匹配，正向肯定预查，在任何匹配pattern的字符串开始处匹配查找字符串，该匹配不需要获取供以后使用。例如，“Windows(?=95\|98\|NT\|2000)”能匹配“Windows2000”中的“Windows”，但不能匹配“Windows3.1”中的“Windows”。预查不消耗字符，也就是说，在一个匹配发生后，在最后一次匹配之后立即开始下一次匹配的搜索，而不是从包含预查的字符之后开始。
`(?!pattern)`	非获取匹配，正向否定预查，在任何不匹配pattern的字符串开始处匹配查找字符串，该匹配不需要获取供以后使用。例如“Windows(?!95\|98\|NT\|2000)”能匹配“Windows3.1”中的“Windows”，但不能匹配“Windows2000”中的“Windows”。
`(?<=pattern)`	非获取匹配，反向肯定预查，与正向肯定预查类似，只是方向相反。例如，“(?<=95\|98\|NT\|2000)Windows”能匹配“2000Windows”中的“Windows”，但不能匹配“3.1Windows”中的“Windows”。*python的正则表达式没有完全按照正则表达式规范实现，所以一些高级特性建议使用其他语言如java、scala等
`(?<!patte_n)`	非获取匹配，反向否定预查，与正向否定预查类似，只是方向相反。例如“(?<!95\|98\|NT\|2000)Windows”能匹配“3.1Windows”中的“Windows”，但不能匹配“2000Windows”中的“Windows”。*python的正则表达式没有完全按照正则表达式规范实现，所以一些高级特性建议使用其他语言如java、scala等
`x\|y`	匹配x或y。例如，“z\|food”能匹配“z”或“food”(此处请谨慎)。“[z\|f]ood”则匹配“zood”或“food”。
`[xyz]`	字符集合。匹配所包含的任意一个字符。例如，“[abc]”可以匹配“plain”中的“a”。
`[^xyz]`	负值字符集合。匹配未包含的任意字符。例如，“[^abc]”可以匹配“plain”中的“plin”任一字符。
`[a-z]`	字符范围。匹配指定范围内的任意字符。例如，“[a-z]”可以匹配“a”到“z”范围内的任意小写字母字符。注意:只有连字符在字符组内部时,并且出现在两个字符之间时,才能表示字符的范围; 如果出字符组的开头,则只能表示连字符本身.
`[^a-z]`	负值字符范围。匹配任何不在指定范围内的任意字符。例如，“[^a-z]”可以匹配任何不在“a”到“z”范围内的任意字符。
`\b`	匹配一个单词的边界，也就是指单词和空格间的位置（即正则表达式的“匹配”有两种概念，一种是匹配字符，一种是匹配位置，这里的\b就是匹配位置的）。例如，“er\b”可以匹配“never”中的“er”，但不能匹配“verb”中的“er”；“\b1_”可以匹配“1_23”中的“1_”，但不能匹配“21_3”中的“1_”。
`\B`	匹配非单词边界。“er\B”能匹配“verb”中的“er”，但不能匹配“never”中的“er”。
`cx`	匹配由x指明的控制字符。例如，cM匹配一个Control-M或回车符。x的值必须为A-Z或a-z之一。否则，将c视为一个原义的“c”字符。
`\d`	匹配一个数字字符。等价于[0-9]。grep 要加上-P，perl正则支持
`\D`	匹配一个非数字字符。等价于[^0-9]。grep要加上-P，perl正则支持
`\f`	匹配一个换页符。等价于\x0c和\cL。
`\n`	匹配一个换行符。等价于\x0a和\cJ。
`\r`	匹配一个回车符。等价于\x0d和\cM。
`\s`	匹配任何不可见字符，包括空格、制表符、换页符等等。等价于[ \f\n\r\t\v]。
`\S`	匹配任何可见字符。等价于[^ \f\n\r\t\v]。
`\t`	匹配一个制表符。等价于\x09和\cI。
`\v`	匹配一个垂直制表符。等价于\x0b和\cK。
`\w`	匹配包括下划线的任何单词字符。类似但不等价于“[A-Za-z0-9_]”，这里的"单词"字符使用Unicode字符集。
`\W`	匹配任何非单词字符。等价于“[^A-Za-z0-9_]”。
`\xn`	匹配n，其中n为十六进制转义值。十六进制转义值必须为确定的两个数字长。例如，“\x41”匹配“A”。“\x041”则等价于“\x04&1”。正则表达式中可以使用ASCII编码。
`\num`	匹配num，其中num是一个正整数。对所获取的匹配的引用。例如，“(.)\1”匹配两个连续的相同字符。
`\n`	标识一个八进制转义值或一个向后引用。如果n之前至少n个获取的子表达式，则n为向后引用。否则，如果n为八进制数字（0-7），则n为一个八进制转义值。
`\nm`	标识一个八进制转义值或一个向后引用。如果nm之前至少有nm个获得子表达式，则nm为向后引用。如果nm之前至少有n个获取，则n为一个后跟文字m的向后引用。如果前面的条件都不满足，若n和m均为八进制数字（0-7），则nm将匹配八进制转义值nm。
`\nml`	如果n为八进制数字（0-7），且m和l均为八进制数字（0-7），则匹配八进制转义值nml。
`\un`	匹配n，其中n是一个用四个十六进制数字表示的Unicode字符。例如，\u00A9匹配版权符号（©）。
`\p{P}`	小写 p 是 property 的意思，表示 Unicode 属性，用于 Unicode 正表达式的前缀。中括号内的“P”表示Unicode 字符集七个字符属性之一：标点字符。其他六个属性：L：字母；M：标记符号（一般不会单独出现）；Z：分隔符（比如空格、换行等）；S：符号（比如数学符号、货币符号等）；N：数字（比如阿拉伯数字、罗马数字等）；C：其他字符。注：此语法部分语言不支持，例：javascript。*
`<>`	匹配词（word）的开始（<）和结束（>）。例如正则表达式<the>能够匹配字符串"for the wise"中的"the"，但是不能匹配字符串"otherwise"中的"the"。注意：这个元字符不是所有的软件都支持的。
`( )`	将( 和 ) 之间的表达式定义为“组”（group），并且将匹配这个表达式的字符保存到一个临时区域（一个正则表达式中最多可以保存9个），它们可以用 1 到9 的符号来引用。
`\|`	将两个匹配条件进行逻辑“或”（or）运算。例如正则表达式(him\|her) 匹配"it belongs to him"和"it belongs to her"，但是不能匹配"it belongs to them."。注意：这个元字符不是所有的软件都支持的。

1.2 分组

用()表示的就是要提取的分组，一般用于提取子串
比如：^(\d{3})-(\d{3,8)$ <===><从匹配的字符串中提取出区号和本地号码>

字符	描述
`\|`	匹配左右任意一个表达式
`(re)`	匹配括号内的表达式，也表示一个组
`(?:re)`	匹配括号内的表达式，但不表示一个组
`(?P<name>)`	分组起别名, group可以根据别名取出,比如(?P\d)match后的结果调 m.group(‘first’)可以拿到第一个分组中匹配的记过
`(?=re)`	前向肯定断言,如果当前包含的正则表达式在当前位置成功匹配,则代表成功,否则失败。一旦该部分正则表达式被匹配引擎尝试过就不会继续进行匹配了;剩下的模式在此断言开始的地方继续尝试。
`(?!re)`	前向否定断言,作用与上面的相反
`(?<=>re)`	后向肯定断言,作用和(?=re)相同,只是方向相反
`(?<!re)`	后向否定断言,作用于(?!re)相同,只是方向想法

1.3 flags(可选标志位)表

多个标签可通过按位OR(|)进行连接，比如：re.I|re.M
在正则字符串前加的’r’,是告诉编译器这个String是个raw String(元字符串)，不需要反斜杠进行转义

修饰符	描述
`re.I`	使匹配对大小写不敏感
`re.L`	做本地化识别（locale-aware）匹配
`re.M`	多行匹配，影响`^`和`$`
`re.S`	使`.`匹配包括换行在内的所有字符
`re.U`	根据Unicode字符集解析字符。这个标志影响`\w`、`\W`、`\b`、`\B`
`re.X`	该标志通过给予你更灵活的格式以便你将正则表达式写的更易于理解

2、最常用的正则表示式

2.1 数字校验的正则表达式

序号	描述	正则表达式
1	数字	`^[0-9]*$`
2	n位的数字	`^\d{n}$`
3	至少n位的数字	`^\d{n,}$`
4	m-n位的数字	`^\d{m,n}$`
5	零和非零开头的数字	`^(0\|[1-9][0-9]*)$`
6	非零开头的最多带两位小数的数字	`^([1-9][0-9]*)+(.[0-9]{1,2})?$`
7	带1-2位小数的正数或负数	`^(\-)?\d+(\.\d{1,2})?$`
8	正数、负数、和小数	`^(\-\|\+)?\d+(\.\d+)?$`
9	有两位小数的正实数	`^[0-9]+(.[0-9]{2})?$`
10	有1~3位小数的正实数	`^[0-9]+(.[0-9]{1,3})?$`
11	非零的正整数	`^[1-9]\d$` 或 `^([1-9][0-9]){1,3}$`或 `^\+?[1-9][0-9]*$`
12	非零的负整数	`^\-[1-9][]0-9"$` 或 `^-[1-9]\d$`
13	非负整数	`^\d+$` 或 `^[1-9]\d*\|0$`
14	非正整数	`^-[1-9]\d*\|0$` 或 `^((-\d+)\|(0+))$`
15	非负浮点数	`^\d+(\.\d+)?$` 或 `^[1-9]\d\.\d\|0\.\d[1-9]\d\|0?\.0+\|0$`
16	非正浮点数	`^((-\d+(\.\d+)?)\|(0+(\.0+)?))$` 或 `^(-([1-9]\d\.\d\|0\.\d[1-9]\d))\|0?\.0+\|0$`
17	正浮点数	`^[1-9]\d\.\d\|0\.\d[1-9]\d$` 或 `^(([0-9]+\.[0-9][1-9][0-9])\|([0-9][1-9][0-9]\.[0-9]+)\|([0-9][1-9][0-9]))$`
18	负浮点数	`^-([1-9]\d\.\d\|0\.\d[1-9]\d)$` 或 `^(-(([0-9]+\.[0-9][1-9][0-9])\|([0-9][1-9][0-9]\.[0-9]+)\|([0-9][1-9][0-9])))$`
19	浮点数	`^(-?\d+)(\.\d+)?$` 或 `^-?([1-9]\d\.\d\|0\.\d[1-9]\d\|0?\.0+\|0)$`

2.2 字符校验的正则表达式

序号	名称	正则表达式
1	汉字	`^[\u4e00-\u9fa5]{0,}$`
2	汉字	`[\u4E00-\u9FA5]`
3	全角符号	`[\uFF00-\uFFFF]`
4	半角符号	`[\u0000-\u00FF]`
5	匹配除 `\n` 以外的任何字符	`.*`
6	英文和数字	`^[A-Za-z0-9]+$` 或 `^[A-Za-z0-9]{4,40}$`
7	长度为3-20的所有字符	`^.{3,20}$`
8	由26个英文字母组成的字符串	`^[A-Za-z]+$`
9	由26个大写英文字母组成的字符串	`^[A-Z]+$`
10	由26个小写英文字母组成的字符串	`^[a-z]+$`
11	由数字和26个英文字母组成的字符串	`^[A-Za-z0-9]+$`
12	由数字、26个英文字母或者下划线组成的字符串	`^\w+$` 或 `^\w{3,20}$`
13	中文、英文、数字包括下划线	`^[\u4E00-\u9FA5A-Za-z0-9_]+$`
14	中文、英文、数字但不包括下划线等符号	`^[\u4E00-\u9FA5A-Za-z0-9]+$` 或 `^[\u4E00-\u9FA5A-Za-z0-9]{2,20}$`

2.3 特殊需求的正则表达式

序号	名称	正则表达式
1	Email地址	`^\w+([-+.]\w+)@\w+([-.]\w+)\.\w+([-.]\w+)*$`
2	域名	`[a-zA-Z0-9][-a-zA-Z0-9]{0,62}(/.[a-zA-Z0-9][-a-zA-Z0-9]{0,62})+/.?`
3	InternetURL	`[a-zA-z]+://[^\s]* 或 ^http://([\w-]+\.)+[\w-]+(/[\w-./?%&=]*)?$`
4	手机号码	`^(13[0-9]\|14[5\|7]\|15[0\|1\|2\|3\|5\|6\|7\|8\|9]\|18[0\|1\|2\|3\|5\|6\|7\|8\|9])\d{8}$`
5	电话号码(“XXX-XXXXXXX”、“XXXX-XXXXXXXX”、“XXX-XXXXXXX”、“XXX-XXXXXXXX”、"XXXXXXX"和"XXXXXXXX)	`^(\(\d{3,4}-)\|\d{3.4}-)?\d{7,8}$`
6	国内电话号码(0511-4405222、021-87888822)	`\d{3}-\d{8}\|\d{4}-\d{7}`
7	身份证号(15位、18位数字)	`^\d{15}\|\d{18}$`
8	短身份证号码(数字、字母x结尾)	`^([0-9]){7,18}(x\|X)?$` 或 `^\d{8,18}\|[0-9x]{8,18}\|[0-9X]{8,18}?$`
9	帐号是否合法(字母开头，允许5-16字节，允许字母数字下划线)	`^[a-zA-Z][a-zA-Z0-9_]{4,15}$`
10	密码(以字母开头，长度在6~18之间，只能包含字母、数字和下划线)	`^[a-zA-Z]\w{5,17}$`
11	强密码(必须包含大小写字母和数字的组合，不能使用特殊字符，长度在8-10之间)	`^(?=.\d)(?=.[a-z])(?=.*[A-Z]).{8,10}$`
12	日期格式	`^\d{4}-\d{1,2}-\d{1,2}`
13	一年的12个月(01～09和1～12)	`^(0?[1-9]\|1[0-2])$`
14	一个月的31天(01～09和1～31)	`^((0?[1-9])\|((1\|2)[0-9])\|30\|31)$`
15	“10000.00” 和 “10,000.00”, 和没有 “分” 的 “10000” 和 “10,000”	`^[1-9][0-9]*$`
16	这表示任意一个不以0开头的数字,但是,这也意味着一个字符"0"不通过,所以我们采用下面的形式	`^(0\|[1-9][0-9]*)$`
17	一个0或者一个不以0开头的数字.我们还可以允许开头有一个负号	`^(0\|-?[1-9][0-9]*)$`
18	这表示一个0或者一个可能为负的开头不为0的数字.让用户以0开头好了.把负号的也去掉,因为钱总不能是负的吧.下面我们要加的是说明可能的小数部分	`^[0-9]+(.[0-9]+)?$`
19	必须说明的是,小数点后面至少应该有1位数,所以"10."是不通过的,但是 “10” 和 “10.2” 是通过的	`^[0-9]+(.[0-9]{2})?$`
20	这样我们规定小数点后面必须有两位,如果你认为太苛刻了,可以这样	`^[0-9]+(.[0-9]{1,2})?$`
21	这样就允许用户只写一位小数.下面我们该考虑数字中的逗号了,我们可以这样	`^[0-9]{1,3}(,[0-9]{3})*(.[0-9]{1,2})?$`
22	1到3个数字,后面跟着任意个逗号+3个数字,逗号成为可选,而不是必须	`^([0-9]+\|[0-9]{1,3}(,[0-9]{3})*)(.[0-9]{1,2})?$`
23	xml文件	`^([a-zA-Z]+-?)+[a-zA-Z0-9]+\\.[x\|X][m\|M][l\|L]$`
24	中文字符的正则表达式	`[\u4e00-\u9fa5]`
25	双字节字符	`[^\x00-\xff]` (包括汉字在内，可以用来计算字符串的长度(一个双字节字符长度计2，ASCII字符计1))
26	空白行的正则表达式	`\n\s*\r`(可以用来删除空白行)
27	HTML标记的正则表达式	`<(\S?)[^>]>.?</\1>\|<.? />` (网上流传的版本太糟糕，上面这个也仅仅能部分，对于复杂的嵌套标记依旧无能为力)
28	首尾空白字符的正则表达式	`^\s\|\s$或(^\s)\|(\s$)` (可以用来删除行首行尾的空白字符(包括空格、制表符、换页符等等)，非常有用的表达式)
29	腾讯QQ号	`[1-9][0-9]{4,}`(腾讯QQ号从10000开始)
30	中国邮政编码	`[1-9]\d{5}(?!\d)` (中国邮政编码为6位数字)
31	IP地址	`\d+\.\d+\.\d+\.\d+` (提取IP地址时有用)
32	IP地址	`((?:(?:25[0-5]\|2[0-4]\\d\|[01]?\\d?\\d)\\.){3}(?:25[0-5]\|2[0-4]\\d\|[01]?\\d?\\d))`
33	IP-v4地址	`\\b(?:(?:25[0-5]\|2[0-4][0-9]\|[01]?[0-9][0-9]?)\\.){3}(?:25[0-5]\|2[0-4][0-9]\|[01]?[0-9][0-9]?)\\b` (提取IP地址时有用)
34	校验IP-v6地址	(([0-9a-fA-F]{1,4}:){7,7}[0-9a-fA-F]{1,4}\|([0-9a-fA-F]{1,4}:){1,7}:\|([0-9a-fA-F]{1,4}:){1,6}:[0-9a-fA-F]{1,4}\|([0-9a-fA-F]{1,4}:){1,5}(:[0-9a-fA-F]{1,4}){1,2}\|([0-9a-fA-F]{1,4}:){1,4}(:[0-9a-fA-F]{1,4}){1,3}\|([0-9a-fA-F]{1,4}:){1,3}(:[0-9a-fA-F]{1,4}){1,4}\|([0-9a-fA-F]{1,4}:){1,2}(:[0-9a-fA-F]{1,4}){1,5}\|[0-9a-fA-F]{1,4}:((:[0-9a-fA-F]{1,4}){1,6})\|:((:[0-9a-fA-F]{1,4}){1,7}\|:)\|fe80:(:[0-9a-fA-F]{0,4}){0,4}%[0-9a-zA-Z]{1,}\|::(ffff(:0{1,4}){0,1}:){0,1}((25[0-5]\|(2[0-4]\|1{0,1}[0-9]){0,1}[0-9])\\.){3,3}(25[0-5]\|(2[0-4]\|1{0,1}[0-9]){0,1}[0-9])\|([0-9a-fA-F]{1,4}:){1,4}:((25[0-5]\|(2[0-4]\|1{0,1}[0-9]){0,1}[0-9])\\.){3,3}(25[0-5]\|(2[0-4]\|1{0,1}[0-9]){0,1}[0-9]))
35	子网掩码	`((?:(?:25[0-5]\|2[0-4]\\d\|[01]?\\d?\\d)\\.){3}(?:25[0-5]\|2[0-4]\\d\|[01]?\\d?\\d))`
36	校验日期	`^(?:(?!0000)[0-9]{4}-(?:(?:0[1-9]\|1[0-2])-(?:0[1-9]\|1[0-9]\|2[0-8])\|(?:0[13-9]\|1[0-2])-(?:29\|30)\|(?:0[13578]\|1[02])-31)\|(?:[0-9]{2}(?:0[48]\|[2468][048]\|[13579][26])\|(?:0[48]\|[2468][048]\|[13579][26])00)-02-29)$`(“yyyy-mm-dd“ 格式的日期校验，已考虑平闰年。)
37	抽取注释	`<!--(.*?)-->`
38	查找CSS属性	`^\\s[a-zA-Z\\-]+\\s[:]{1}\\s[a-zA-Z0-9\\s.#]+[;]{1}`
39	提取页面超链接	`(<a\\s(?!.\\brel=)[^>])(href="https?:\\/\\/)((?!(?:(?:www\\.)?'.implode('\|(?:www\\.)?', $follow_list).'))[^" rel="external nofollow" ]+)"((?!.\\brel=)[^>])(?:[^>])>`
40	提取网页图片	`\\< [img][^\\\\>][src] = [\\"\\']{0,1}([^\\"\\'\\ >]*)`
41	提取网页颜色代码	`^#([A-Fa-f0-9]{6}\|[A-Fa-f0-9]{3})$`
42	文件扩展名效验	`^([a-zA-Z]\\:\|\\\\)\\\$[^\\\\]+\\\$[^\\/:?"<>\|]+\\.txt(l)?$`
43	判断IE版本	`^.MSIE [5-8](?:\\.[0-9]+)?(?!.Trident\\/[5-9]\\.0).*$`