正则表达式(初学者,基础)

今天开始学习正则表达式,从我第一次接触正则表达式的时候,我就觉得这个东西是个坑死人的东西,真的是非常的不好理解和记忆,但是没办法,装逼需要嘛,不学怎么装逼呢?所以无论如何一定要学会,学好,把这个文章看完,我相信你基本上就能开始思考如何写正则了,下面开始正题吧。

推荐学习资料:

正则表达式30分钟入门教程

微软的正则表达式教程



\b是正则表达式规定的一个特殊代码,也叫元字符,代表着单子的开始或结尾,也就是单词的分界处,虽然通常英文的单词是由空格,标点符号或者换行来分隔的,但是\b并不匹配这些单词分隔字符中的任何一个,它只匹配一个位置。

  .   是一个另一个元字符,匹配除了换行以外的任意字符。

  *  同样是元字符,不过它代表的不是字符,也不是位置,而是数量,它指定*前边的内容可以连续重复使用任意次以使整个表达式得到匹配,因此.*连在一起就意味着任意数量的不包含换行的字符,\bhi\b.*\bLucy\b 的意思就是:先是一个hi单词,然后是任意个字符(不换行的字符),最后是Lucy这个单词。

\d是一个元字符匹配1位数字,举个例子,中国的电话号码 027-83747123  前面是3个数字,后面是8个数字,中间一个-(不是元字符),怎么写正则呢,前面说到\d是匹配一位数字,0\d\d-\d\d\d\d\d\d\d\d,这样就算是写好了,这样写没错,但是看起来会很繁琐,我们来改写一下,0\d{2}-\d{8},这里\d后面的{2}{8}的意思是前面\d必须连续重复匹配2次(8次)

\s 匹配任意的空白符,包括空格,制表符(tab),换行符,中文全角空格等。

\w匹配字母或数字或下划线或汉字等。

^元字符匹配字符串的开始

$匹配字符串的结束


下面来看一些例子:

\ba\w*\b   意思是匹配以字母a开头的单词,先是某个单词开始处(\b),然后是a,然后是任意数量的字母或数字(\w*),最后是单词结束处(\b)。

\d+ 匹配1个或更多连续的数字,这里+是和*类似的元字符,不同的是*匹配重复任意次(可能是0次),而+则是匹配重复一次或更多次

\b\w{6}\b 匹配刚好6个字符的单词

^\d{5,12}$  匹配5到12位的数字,一般可用作qq号的验证


字符转义

如果你想要查找元字符本身的话,比如. * \ 的话,就需要用到转义了,\就是用来取消这些字符的特殊意义的,因此,当你需要查找\本身的时候你就得用\\

例如:deerchao\.net 匹配deer.net  ,  C:\\Windows匹配C:\Windows


常用限定符

* 重复0次或更多次

+ 重复1次或更多次

?重复0次或1次

{n}重复n次

{n,}重复n次或更多次

{n,m}重复n到m次


例子来了:

Windows\d+ 匹配windows后面跟着1个或更多数字


如果你想匹配没有预定义元字符的字符集合(比如a,e,I,o,u)应该怎么办?

你只需要在方括号里列出他们就行了[aeiou]就能匹配任何一个英文元音字母,同理,['.?!']匹配标点符号.?!

我们可以轻松的指定一个字符的范围,像[0-9]代表的含义与\d就是完全一致的:一位数字,同理[a-z0-9A-Z]也完全等于\w(只考虑英文的情况)


下面要讲一下分枝条件:

分支条件可以这样理解就是 ‘或运算’用 | 把不同的规则分隔开,来举几个例子:

0\d{2}-\d{8}|0\d{3}-\d{7}这个表达式能匹配2种以连字号分隔的电话号码,一种是3位的区号,8位本地号(如010-12345678),一种是4位区号,7位本地号(0376-2233445)

\(?0\d{2}\)?[- ]?\d{8}|0\d{2}[- ]?\d{8}这个表达试 匹配3位区号的电话号码,其中区号可以用小括号括起来,也可以不用,区号与本地号间可以用连字号或空格间隔,也可以没有间隔。你可以试试用分支条件把这个表达式扩展成也支持4位区号的。

\d{5}-\d{4}|\d{5}这个表达式用于匹配美国的邮政编码。美国的邮政编码的规则是5位数字或者用连字号间隔的9位数字,之所以要给出这个例子是因为他能说明一个问题:使用分支条件时,要注意哥哥条件的顺序,如果你把他改成\d{5}|\d{5}-\d{4}的话,那么只会匹配5位的邮编(以及9位邮编的前5位)。原因是匹配分支条件时将会从左到右的测试每个条件,如果满足了某个分支条件的话,就不会再去管其他的条件了。


分组:分组是什么意思呢,这样理解吧,就是当你想要重复一个表达式的时候就可以用到分组,

现在我们来做一个题目,写一个能够匹配ip地址的正则表达式(127.0.0.1),这个ip应该很熟悉,localhost嘛,加个端口号:8080就能跑起来了,本地的嘛,现在写一个正则,我们发现4个数字3个点,这个时候就能用到分组的知识了,(\d{1,3}\.){3}\d{1,3}是一个ip 的地址匹配表达式,我来分析一下这个表达式,\d{1,3}是1到3个数字,(\d{1,3}\.){3}是1-3个数字重复三次,这里用的小括号后面接限定符就是用的分组,最后在加上一个1-3的数字,很显然,这样一个正则肯定是错的,我们的ip地址没有大于255的吧,但是这个正则能匹配出999来,肯定是错的,那我们来分析一下,255第一个是0-2,第二个是0-9,第三个是0-9,然而我们需要分支条件来写,2开头的为一类,1开头的为1类,2后面可以是0-4或者5,这样分类下去就好写了,((2[0-4]\d|25[0-5]|[01]?\d\d?)\.){3}(2[0-4]\d|25[0-5]|[01]?\d\d?)这是最终的结果


反义:有时候需要查找不属于某个能简单定义的字符类,比如查找除了数字意外的,这个时候就需要用到反义了,

常用的反义代码,

\W 匹配任意不是字母,数字下划线,汉字的字符

\S 匹配任意不是空白符的字符

\D 匹配任意非数字的字符

\B 匹配不是单词开头或结束的位置

[^x]匹配除了x意外的任意字符

[^aeiou]匹配除了aeiou这几个字母以外的任意字符


这下面这一块还没搞懂,我去找点资料学习下再来记录,

后向引用

零宽断言

负向零宽断言

贪婪与懒惰

平衡组与递归匹配






















  • 1
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

会php的猪

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值