迅速了解:正则表达式

最新推荐文章于 2024-08-23 09:55:33 发布

52kuma

最新推荐文章于 2024-08-23 09:55:33 发布

阅读量449

点赞数

分类专栏： java

java 专栏收录该内容

7 篇文章 0 订阅

订阅专栏

1. \b 元字符主要用于精确匹配，代表单词的开头和结尾，也就是单词的分界处。

假如你要找的是hi后面不远处跟着一个Lucy，你应该用\bhi\b.*\bLucy\b。

.*连在一起就意味着任意数量的不包含换行的字符。

2. \d是个新的元字符，匹配一位数字(0，或1，或2，或……)。

-不是元字符，只匹配它本身——连字符(或者减号，或者中横线，或者随你怎么称呼它)。

0\d\d-\d\d\d\d\d\d\d\d匹配这样的字符串：以0开头，然后是两个数字，然后是一个连字号“-”，最后是8个数字。

也可以方便的写成:0\d{2}-\d{8},\d后面的{2}({8})的意思是前面\d必须连续重复匹配2次(8次)。

3. \s匹配任意的空白符，包括空格，制表符(Tab)，换行符，中文全角空格等。

4. \w匹配字母或数字或下划线或汉字等。

\d+匹配1个或更多连续的数字。这里的+是和*类似的元字符，不同的是 *匹配重复任意次(可能是0次)，而+则匹配重复1次或更多次。

表1.常用的元字符
代码	说明
.	匹配除换行符以外的任意字符
\w	匹配字母或数字或下划线或汉字
\s	匹配任意的空白符
\d	匹配数字
\b	匹配单词的开始或结束
^	匹配字符串的开始
$	匹配字符串的结束

如果你想查找元字符本身的话，比如你查找.,或者*,就出现了问题：你没办法指定它们，因为它们会被解释成别的意思。这时你就得使用\来取消这些字符的特殊意义。因此，你应该使用\.和\*。当然，要查找\本身，你也得用\\.

表2.常用的限定符
代码/语法	说明
*	重复零次或更多次
+	重复一次或更多次
?	重复零次或一次
{n}	重复n次
{n,}	重复n次或更多次
{n,m}	重复n到m次

我们也可以轻松地指定一个字符范围，像[0-9]代表的含意与\d就是完全一致的：一位数字；同理[a-z0-9A-Z_]也完全等同于\w

下面是一个更复杂的表达式：\(?0\d{2}[) -]?\d{8}。

这个表达式可以匹配几种格式的电话号码，像(010)88886666，或022-22334455，或02912345678等。我们对它进行一些分析吧：首先是一个转义字符\(,它能出现0次或1次(?),然后是一个0，后面跟着2个数字(\d{2})，然后是)或-或空格中的一个，它出现1次或不出现(?)，最后是8个数字(\d{8})。

“(”和“)”也是元字符，后面的分组节里会提到，所以在这里需要使用转义。

4.\d{5}-\d{4}|\d{5}这个表达式用于匹配美国的邮政编码。美国邮编的规则是5位数字，或者用连字号间隔的9位数字。之所以要给出这个例子是因为它能说明一个问题：使用分枝条件时，要注意各个条件的顺序。如果你把它改成\d{5}|\d{5}-\d{4}的话，那么就只会匹配5位的邮编(以及9位邮编的前5位)。原因是匹配分枝条件时，将会从左到右地测试每个条件，如果满足了某个分枝的话，就不会去再管其它的条件了。

表3.常用的反义代码
代码/语法	说明
\W	匹配任意不是字母，数字，下划线，汉字的字符
\S	匹配任意不是空白符的字符
\D	匹配任意非数字的字符
\B	匹配不是单词开头或结束的位置
[^x]	匹配除了x以外的任意字符
[^aeiou]	匹配除了aeiou这几个字母以外的任意字符