2024年最全正则表达式基础和使用及常用表达式(2)，面试考点与面试技巧有哪些

2401_84563354

于 2024-05-17 06:43:44 发布

阅读量968

点赞数 28

分类专栏：程序员文章标签： android 面试学习

本文链接：https://blog.csdn.net/2401_84563354/article/details/138988749

版权

程序员专栏收录该内容

185 篇文章 0 订阅

订阅专栏

尾声

开发是需要一定的基础的，我是08年开始进入Android这行的，在这期间经历了Android的鼎盛时期，和所谓的Android”凉了“。中间当然也有着，不可说的心酸，看着身边朋友，同事一个个转前端，换行业，其实当时我的心也有过犹豫，但是我还是坚持下来了，这次的疫情就是一个好的机会，大浪淘沙，优胜劣汰。再等等，说不定下一个黄金浪潮就被你等到了。

330页 PDF Android核心笔记

几十套阿里、字节跳动、腾讯、华为、美团等公司2020年的面试题

PDF和思维脑图，包含知识脉络 + 诸多细节

Android进阶系统学习视频

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化学习资料的朋友，可以戳这里获取

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！


给定一个正则表达式和另一个字符串，我们可以达到如下的目的：

给定的字符串是否符合正则表达式的过滤逻辑（称作“匹配”）；
可以通过正则表达式，从字符串中获取我们想要的特定部分。

正则表达式的特点是：

灵活性、逻辑性和功能性非常的强；
可以迅速地用极简单的方式达到字符串的复杂控制。
对于刚接触的人来说，比较晦涩难懂。

常用的使用情形是对用户的提交或输入的内容进行规则匹配检测，保证内容的合法性。文章分为3个部分，先是基础，然后是Java代码中的使用及相关重要API，最后是常用的正则表达式。其实学会了基础，我们完全可以写出自己定义的规则，写在这里的目的也是为了后期自己在写的时候方便查阅，把它当作一个工具来使用，好了不多说了，那就先说说正则表达式的基础语法吧。

1，正则表达式的基本语法

| 元字符 | 说明 |

| — | — |

| . | 匹配任何单个字符。例如正则表达式“b.g”能匹配如下字符串：“big”、“bug”、“b g”，但是不匹配“buug”。 |

| $ | 匹配行结束符。例如正则表达式“EJB$”能够匹配字符串“I like EJB”的末尾，但是不能匹配字符串“J2EE Without EJBs！”。 |

| ^ | 匹配一行的开始。例如正则表达式“^Spring”能够匹配字符串“Spring is a J2EE framework”的开始，但是不能匹配“I use Spring in my project”。 |

| * | 匹配0至多个在它之前的字符。例如正则表达式“zo*”能匹配“z”以及“zoo”；正则表达式“.*”意味着能够匹配任意字符串。 |

| / | 转义符，用来将元字符当作普通的字符来进行匹配。例如正则表达式/$被用来匹配美元符号，而不是行尾；正则表达式/.用来匹配点字符，而不是任何字符的通配符。 |

| [] | 匹配括号中的任何一个字符。例如正则表达式“b[aui]g”匹配bug、big和bug，但是不匹配beg。可以在括号中使用连字符“-”来指定字符的区间来简化表示，例如正则表达式[0-9]可以匹配任何数字字符，这样正则表达式“a[]c”就可以匹配“a0c”、“a1c”、“a2c”等字符串；还可以制定多个区间，例如“[A-Za-z]”可以匹配任何大小写字母。还有一个相配合使用的元字符“^{”，用在这里并不像前边的那个“}”一样表示匹配行开始，而是表示“排除”，要想匹配除了指定区间之外的字符，就可以在左边的括号和第一个字符之间使用^{字符，例如“[}163A-Z]”将能偶匹配除了1、6、3和所有大写字母之外的任何字符。 |

| ( ) | 将 () 之间括起来的表达式定义为“组”(group)，并且将匹配这个表达式的字符保存到一个临时区域,这个元字符在字符串提取的时候非常有用。 |

| + | 匹配前面的子表达式一次或多次。例如正则表达式9+匹配9、99、999等。 |

| ? | 匹配前面的子表达式零次或一次。例如，“do(es)?” 可以匹配 “do” 或 “does” 中的"do" 。此元字符还有另外一个用途，就是表示非贪婪模式匹配，后边将有介绍 |

| {n} | 匹配确定的 n 次。例如，“e{2}”不能匹配“bed”中的“d”，但是能匹配“seed”中的两个“e”。 |

| {n,} | 至少匹配_n_次。例如，“e{2,}”不能匹配“bed”中的“e”，但能匹配“seeeeeeeed”中的所有“e”。 |

| {n,m} | 最少匹配 n 次且最多匹配 m 次。“e{1,3}”将匹配“seeeeeeeed”中的前三个“e”。

下面是几个例子：

“ab*”：表示一个字符串有一个a后面跟着零个或若干个b。（“a”, “ab”, “abbb”,……）；

“ab+”：表示一个字符串有一个a后面跟着至少一个b或者更多；

“ab?”：表示一个字符串有一个a后面跟着零个或者一个b；

“a?b+$”：表示在字符串的末尾有零个或一个a跟着一个或几个b。

你也可以使用范围，用大括号括起，用以表示重复次数的范围。

“ab{2}”：表示一个字符串有一个a跟着2个b（“abb”）；

“ab{2,}”：表示一个字符串有一个a跟着至少2个b；

“ab{3,5}”：表示一个字符串有一个a跟着3到5个b。

请注意，你必须指定范围的下限（如：“{0,2}“而不是”{,2}”）。还有，你可能注意到了，‘*’，'+‘和’?'相当于"{0,}“，”{1,}“和”{0,1}"。

还有一个’¦’，表示“或”操作：

“hi¦hello”：表示一个字符串里有"hi"或者"hello"；

“(b¦cd)ef”：表示"bef"或"cdef"；

“(a¦b)*c”：表示一串"a"“b"混合的字符串后面跟一个"c”；

'.'可以替代任何字符：

“a.[0-9]”：表示一个字符串有一个"a"后面跟着一个任意字符和一个数字；

“^.{3}$”：表示有任意三个字符的字符串（长度为3个字符）；

方括号表示某些字符允许在一个字符串中的某一特定位置出现：

“[ab]”：表示一个字符串有一个"a"或"b"（相当于"a¦b"）；

“[a-d]”：表示一个字符串包含小写的’a’到’d’中的一个（相当于"a¦b¦c¦d"或者"[abcd]"）；

“^[a-zA-Z]”：表示一个以字母开头的字符串；

“[0-9]%”：表示一个百分号前有一位的数字；

“,[a-zA-Z0-9]$”：表示一个字符串以一个逗号后面跟着一个字母或数字结束。

你也可以在方括号里用’^{‘表示不希望出现的字符，’}'应在方括号里的第一位。（如："%[^a-zA-Z]%"表示两个百分号中不应该出现字母）。

为了逐字表达，你必须在"^.$()¦*+?{\"这些字符前加上转移字符’\'。

请注意在方括号中，不需要转义字符。

**正则表达式的构造摘要

构造匹配** 字符

x 字符 x

\\ 反斜线字符

\0n 带有八进制值 0 的字符 n (0 <= n <= 7)

\0nn 带有八进制值 0 的字符 nn (0 <= n <= 7)

\0mnn 带有八进制值 0 的字符 mnn（0 <= m <= 3、0 <= n <= 7）

\xhh 带有十六进制值 0x 的字符 hh

\uhhhh 带有十六进制值 0x 的字符 hhhh

\t 制表符 (‘\u0009’)

\n 新行（换行）符 (‘\u000A’)

\r 回车符 (‘\u000D’)

\f 换页符 (‘\u000C’)

\a 报警 (bell) 符 (‘\u0007’)

\e 转义符 (‘\u001B’)

\cx 对应于 x 的控制符

字符类

[abc] a、b 或 c（简单类）

[^abc] 任何字符，除了 a、b 或 c（否定）

[a-zA-Z] a 到 z 或 A 到 Z，两头的字母包括在内（范围）

[a-d[m-p]] a 到 d 或 m 到 p：[a-dm-p]（并集）

[a-z&&[def]] d、e 或 f（交集）

[a-z&&[^bc]] a 到 z，除了 b 和 c：[ad-z]（减去）

[a-z&&[^m-p]] a 到 z，而非 m 到 p：[a-lq-z]（减去）

预定义字符类

. 任何字符（与行结束符可能匹配也可能不匹配）

\d 数字：[0-9]

\D 非数字： [^0-9]

\s 空白字符：[ \t\n\x0B\f\r]

\S 非空白字符：[^\s]

\w 单词字符：[a-zA-Z_0-9]

\W 非单词字符：[^\w]

2，Java代码中的使用

相关API

一个Pattern对象就是一个正则表达式经编译后的表现模式，也就是前边所说的“模式编译器”；一个Matcher对象是一个状态机器，它根据Pattern对象做为匹配模式对字符串展开匹配检查，也就是前边说的“模式匹配器”。因为模式的编译过程是最先进行且与匹配过程独立的，所以这保证了进行批量字符串匹配时候的运行效率。

Pattern类有如下重要的方法：

(1)public static Pattern compile(String regex)：将给定的正则表达式编译并返回编译后的Pattern对象。

(2)public static Pattern compile(String regex, int flags)：将给定的正则表达式编译并返回编译后的Pattern对象，flag参数表示匹配时的选项，可选的flag参数包括：CASE_INSENSITIVE,COMMENTS，MULTILINE,DOTALL,UNICODE_CASE，CANON_EQ。

(3)public int flags()：返回flag选项参数.

(4)public static boolean matches(String regex, CharSequence input)：直接判断字符序列input是否匹配正则表达regex。前面曾经提到当需要使用一个正则表达式进行多次匹配的时候，对正则表达式进行预编译能够加快运行速度，但是如果这个匹配只进行一次的话，就可以调用这个matches方法直接判断是否匹配，这样就方便多了。这段代码内部的实现代码就是： ```

Pattern.compile(regex).matcher(input).matches()；


  



   Matcher 类有如下重要的方法：



   (1)public boolean matches()：生成一个给定命名的Matcher对象 



   (2)public String pattern()：返回该Pattern对象所编译的正则表达式。 



   (3)public String\[\] split(CharSequence input)将目标字符序列input按照Pattern里所包含的正则表达式为模式进行分割。 



   (4)public String\[\] split(CharSequence input, int limit) 将目标字符序列input按照Pattern里所包含的正则表达式为模式进行分割，参数limit作用是指定要分割的段数，如将limi设为2，那么目标字符序列将根据正则表达式分为割为两段。



   (5)public String group(int group) ：得到匹配结果中提取的第group个分组的值。此方法在字符串提取中经常用到。



   (6)public String replaceAll(String replacement)：用指定的字符串替换匹配的子串。



   指定为字符串的正则表达式必须首先被编译为此类的实例。然后，可将得到的模式用于创建 Matcher 对象，依照正则表达式，该对象可以与任意字符序列匹配。执行匹配所涉及的所有状态都驻留在匹配器中，所以多个匹配器可以共享同一模式。   

  

因此，典型的调用顺序是

Pattern p = Pattern.compile(“a*b”);