正则表达式运算示例

最新推荐文章于 2023-03-29 11:30:20 发布

潘多拉的面

最新推荐文章于 2023-03-29 11:30:20 发布

阅读量1k

点赞数

分类专栏： perl

本文链接：https://blog.csdn.net/lixiaofeng0/article/details/116791803

版权

perl 专栏收录该内容

2 篇文章 0 订阅

订阅专栏

"\b" :不会消耗任何字符只匹配一个位置，常用于匹配单词边界如我想从字符串中"This is Regex"匹配单独的单词 "is" 正则就要写成 "\bis\b"

　　 \b 不会匹配is 两边的字符，但它会识别is 两边是否为单词的边界

"\d": 匹配数字，

　　例如要匹配一个固定格式的电话号码以0开头前4位后7位，如0737-5686123 正则:^0\d\d\d-\d\d\d\d\d\d\d$ 这里只是为了介绍"\d"字符，实际上有更好的写法会在下面介绍。

"\w"：匹配字母，数字，下划线.

　　例如我要匹配"a2345BCD__TTz" 正则："\w+" 这里的"+"字符为一个量词指重复的次数，稍后会详细介绍。

"\s"：匹配空格

　　例如字符 "a b c" 正则："\w\s\w\s\w" 一个字符后跟一个空格，如有字符间有多个空格直接把"\s" 写成 "\s+" 让空格重复

"."：匹配除了换行符以外的任何字符

简写描述.除换行符外的所有字符\w匹配所有字母数字，等同于 [a-zA-Z0-9_]\W匹配所有非字母数字，即符号，等同于： [^\w]\d匹配数字： [0-9]\D匹配非数字： [^\d]\s匹配所有空格字符，等同于： [\t\n\f\r\p{Z}]\S匹配所有非空格字符： [^\s]\f匹配一个换页符\n匹配一个换行符\r匹配一个回车符\t匹配一个制表符\v匹配一个垂直制表符\p匹配 CR/LF（等同于 \r\n），用来匹配 DOS 行终止符

单个字符的匹配

点运算符：

"[abc]": 字符组匹配包含括号内元素的字符

字符集：

字符集也叫做字符类。方括号用来指定一个字符集。在方括号中使用连字符来指定字符集的范围。在方括号中的字符集不关心顺序。例如，表达式[Tt]he 匹配 the 和 The。

方括号中的句号表示句号

否定字符集：

^表示字符的开头，在括号中[^]表示相反的集合。

例如，表达式[^c]ar 匹配一个后面跟着ar的除了c的任意字符

重复次数（量词）：

贪婪(贪心) 如"*"字符贪婪量词会首先匹配整个字符串，尝试匹配时，它会选定尽可能多的内容，如果失败则回退一个字符，然后再次尝试回退的过程就叫做回溯，它会每次回退一个字符，直到找到匹配的内容或者没有字符可以回退。相比下面两种贪婪量词对资源的消耗是最大的，

懒惰(勉强) 如 "?" 懒惰量词使用另一种方式匹配，它从目标的起始位置开始尝试匹配，每次检查一个字符，并寻找它要匹配的内容，如此循环直到字符结尾处。

占有如"+" 占有量词会覆盖事个目标字符串，然后尝试寻找匹配内容，但它只尝试一次，不会回溯，就好比先抓一把石头，然后从石头中挑出黄金

后面跟着元字符 +，* or ? 的，用来指定匹配子模式的次数。这些元字符在不同的情况下有着不同的意思

*：

重复零次或更多

例子：

单匹配单个字符a时

匹配a*

表达式[a-z]* 匹配一个行中所有以小写字母开头的字符串

*字符和.字符搭配可以匹配所有的字符.*。 *和表示匹配空格的符号\s连起来用，如表达式\s*cat\s*匹配 0 或更多个空格开头和 0 或更多个空格结尾的 cat 字符串。

+:

+号匹配+号之前的字符出现 >=1 次。例如表达式c.+t 匹配以首字母c开头以t结尾，中间跟着至少一个字符的字符串。

?:

在正则表达式中元字符 ? 标记在符号前面的字符为可选，即出现 0 或 1 次。例如，表达式 [T]?he 匹配字符串 he 和 The

{}号：

在正则表达式中 {} 是一个量词，常用来一个或一组字符可以重复出现的次数。例如，表达式 [0-9]{2,3} 匹配最少 2 位最多 3 位 0~9 的数字。

`(...)` 特征标群

特征标群是一组写在 (...) 中的子模式。例如之前说的 {} 是用来表示前面一个字符出现指定次数。但如果在 {} 前加入特征标群则表示整个标群内的字符重复 N 次。例如，表达式 (ab)*匹配连续出现 0 或更多个 ab

`|` 或运算符

或运算符就表示或，用作判断条件。

例如 (T|t)he|car 匹配 (T|t)he 或 car。

转码特殊字符

反斜线 \ 在表达式中用于转码紧跟其后的字符。用于指定 { } [ ] / \ + * . $ ^ | ? 这些特殊字符。如果想要匹配这些特殊字符则要在其前面加上反斜线 \。

锚点

^ 用来检查匹配的字符串是否在所匹配字符串的开头。

例如，在 abc 中使用表达式 ^a 会得到结果 a。但如果使用 ^b 将匹配不到任何结果。因为在字符串 abc 中并不是以 b 开头。

例如，^(T|t)he 匹配以 The 或 the 开头的字符串

同理于 ^ 号，$ 号用来匹配字符是否是最后一个。

例如，(at\.)$ 匹配以 at. 结尾的字符串。

断言

`?=...` 正先行断言

?=... 正先行断言，表示第一部分表达式之后必须跟着 ?=...定义的表达式。

返回结果只包含满足匹配条件的第一部分表达式。定义一个正先行断言要使用 ()。在括号内部使用一个问号和等号： (?=...)。

正先行断言的内容写在括号中的等号后面。例如，表达式 (T|t)he(?=\sfat) 匹配 The 和 the，在括号中我们又定义了正先行断言 (?=\sfat) ，即 The 和 the 后面紧跟着 (空格)fat。

`?!...` 负先行断言

负先行断言 ?! 用于筛选所有匹配结果，筛选条件为其后不跟随着断言中定义的格式。 正先行断言 定义和 负先行断言 一样，区别就是 = 替换成 ! 也就是 (?!...)。

表达式 (T|t)he(?!\sfat) 匹配 The 和 the，且其后不跟着 (空格)fat。

`?<= ...` 正后发断言

正后发断言记作(?<=...) 用于筛选所有匹配结果，筛选条件为其前跟随着断言中定义的格式。例如，表达式 (?<=(T|t)he\s)(fat|mat) 匹配 fat 和 mat，且其前跟着 The 或 the。

`?<!...` 负后发断言

负后发断言记作 (?<!...) 用于筛选所有匹配结果，筛选条件为其前不跟随着断言中定义的格式。例如，表达式 (?<!(T|t)he\s)(cat) 匹配 cat，且其前不跟着 The 或 the

标志

标志描述i忽略大小写。g全局搜索。m多行修饰符：锚点元字符 ^$ 工作范围在每行的起始。

忽略大小写（Case Insensitive）

修饰语 i 用于忽略大小写。例如，表达式 /The/gi 表示在全局搜索 The，在后面的 i 将其条件修改为忽略大小写，则变成搜索 the 和 The，g 表示全局搜索。

全局搜索（Global search）

修饰符 g 常用于执行一个全局搜索匹配，即（不仅仅返回第一个匹配的，而是返回全部）。例如，表达式 /.(at)/g 表示搜索任意字符（除了换行）+ at，并返回全部结果

多行修饰符（Multiline）

多行修饰符 m 常用于执行一个多行匹配。

像之前介绍的 (^,$) 用于检查格式是否是在待检测字符串的开头或结尾。但我们如果想要它在每行的开头和结尾生效，我们需要用到多行修饰符 m。

例如，表达式 /at(.)?$/gm 表示小写字符 a 后跟小写字符 t ，末尾可选除换行符外任意字符。根据 m 修饰符，现在表达式匹配每行的结尾

https://zhuanlan.zhihu.com/p/107294963

https://regex101.com/r/7m8me5/1

潘多拉的面

关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
打赏
0
评论
正则表达式运算示例

"\b" :不会消耗任何字符只匹配一个位置，常用于匹配单词边界如我想从字符串中"This is Regex"匹配单独的单词 "is" 正则就要写成 "\bis\b" 　　 \b 不会匹配is 两边的字符，但它会识别is 两边是否为单词的边界"\d": 匹配数字，　　例如要匹配一个固定格式的电话号码以0开头前4位后7位，如0737-5686123 正则:^0\d\d\d-\d\d\d\d\d\d\d$ 这里只是为了介绍"\d"字符，实际上有更好的写法会在下面介绍。...
复制链接

扫一扫