正则表达式

最新推荐文章于 2024-05-20 10:35:51 发布

六又三分之二的阳光

最新推荐文章于 2024-05-20 10:35:51 发布

阅读量112

点赞数

分类专栏： python学习

本文链接：https://blog.csdn.net/weixin_43381734/article/details/84038624

版权

python学习专栏收录该内容

13 篇文章 0 订阅

订阅专栏

用来匹配字符串的，给字符串定义一个规则，凡是符合规则的字符串就认为是匹配了，否则该字符串是不合法的。
在正则表达式中，\d可以匹配一个数字。\w可以匹配一个字母或者数字，.可以匹配任何字符。
‘00\d’可以匹配’007’，但无法匹配’00A’；
‘\d\d\d’可以匹配’010’；
‘\w\w\d’可以匹配’py3’；
‘py.‘可以匹配’pyc’、‘pyo’、‘py!‘等等
要匹配变长的字符，在正则表达式中，用*表示任意个字符（包括0个），用+表示至少一个字符，用?表示0个或1个字符，用{n}表示n个字符，用{n,m}表示n-m个字符：
\d{3}表示匹配3个数字，例如’010’；
\s可以匹配一个空格（也包括Tab等空白符），所以\s+表示至少有一个空格，例如匹配’ ‘，’ ‘等；
\d{3,8}表示3-8个数字，例如’1234567’。
**要做更精确地匹配，可以用[]表示范围，**比如：
[0-9a-zA-Z_]可以匹配一个数字、字母或者下划线；
[0-9a-zA-Z_]+可以匹配至少由一个数字、字母或者下划线组成的字符串，比如’a100’，‘0_Z’，‘Py3000’等等；
[a-zA-Z_][0-9a-zA-Z_]*可以匹配由字母或下划线开头，后接任意个由一个数字、字母或者下划线组成的字符串，也就是Python合法的变量；
[a-zA-Z_][0-9a-zA-Z_]{0, 19}更精确地限制了变量的长度是1-20个字符（前面1个字符+后面最多19个字符）。
A|B可以匹配A或B，所以(P|p)ython可以匹配’Python’或者’python’。
^{表示行的开头，}\d表示必须以数字开头。
$KaTeX parse error: Expected 'EOF', got '\d' at position 8: 表示行的结束，\̲d̲$ 表示必须以数字结束。
你可能注意到了，py也可以匹配’python’，但是加上^py$就变成了整行匹配，就只能匹配’py’了。

re模块

>>> import re
>>> re.match(r'^\d{3}\-\d{3,8}$', '010-12345')
<_sre.SRE_Match object; span=(0, 9), match='010-12345'>
>>> re.match(r'^\d{3}\-\d{3,8}$', '010 12345')
>>>

用户输入一组标签，用正则表达式把不规范的输入转化成正确的数组

>>> re.split(r'[\s\,\;]+', 'a,b;  ; c  d')    #+至少一个字符
['a', 'b', 'c', 'd']

分组
如果正则表达式中定义了组，就可以在Match对象上用group()方法提取出子串来。

注意到group(0)永远是原始字符串，group(1)、group(2)……表示第1、2、……个子串。

>>> m = re.match(r'^(\d{3})-(\d{3,8})$', '010-12345')
>>> m
<_sre.SRE_Match object; span=(0, 9), match='010-12345'>
>>> m.group(0)
'010-12345'
>>> m.group(1)
'010'
>>> m.group(2)
'12345'

编译

>>> import re
# 编译:
>>> re_telephone = re.compile(r'^(\d{3})-(\d{3,8})$')
# 使用：
>>> re_telephone.match('010-12345').groups()
('010', '12345')
>>> re_telephone.match('010-8086').groups()
('010', '8086')

http://deerchao.net/tutorials/regex/regex.htm