爬虫基础———正则表达式

最新推荐文章于 2022-12-01 10:32:24 发布

西楚霸王刘波

最新推荐文章于 2022-12-01 10:32:24 发布

阅读量309

点赞数

分类专栏：技术类

本文链接：https://blog.csdn.net/weixin_43187669/article/details/100072800

版权

技术类专栏收录该内容

37 篇文章 0 订阅

订阅专栏

文章目录

正则表达式简介

为什么要学正则表达式？
实际上爬虫一共就四个主要步骤：

明确目标（要知道你准备在哪个范围或者网站去搜索）
爬（将所有网站的内容全部爬下来）
取（去掉对我们没用的数据）
处理数据（按照我们想要的方式存储和使用）

什么是正则表达式？
正则表达是，又称规则表达式，通常被用来检索，替换那些符合规则的文本。
正则表达式是对字符串操作的一种逻辑公式，就是用事先定义好的一些特定字符、及这些特定字符的组合，组成一个“规则字符串”，这个“规则字符串”用来表达对字符串的一种过滤逻辑。

目的：
给定的字符串是否符合正则表达式的过滤逻辑（“匹配”）；
通过正则表达式，从文本字符串中获取我们想要的特定部分（“过滤”）。
在这里插入图片描述

正则匹配规则：

在这里插入图片描述

正则表达式匹配案例：

匹配所有的qq邮箱， username必须是字母数字或者下划线

匹配北美电话区号
#案例1：匹配所有的qq邮箱， username@qq.com, 其中username必须是字母数字或者下划线，次数为2-12个之间；

 import re
 pattern1 = r'\s\w{2,12}@qq\.com'
 text = ' westos@qq.com  hello@qq.com  dhwehfhjrefhjrehfuhregiuhgggggggggggggiu@qq.com'
 patternObj = re.compile(pattern1)
 result = patternObj.findall(text)
 print(result)
 
 # 案例2：
 #     北美电话的常用格式:(eg: 2703877865)
 #             前3位: 第一位是区号以2~9开头 , 第2位是0~8, 第三位数字可任意;
 #             中间三位数字:第一位是交换机号, 以2~9开头, 后面两位任意
 #             最后四位数字: 数字不做限制;
 pattern2 = r'\(?[2-9][0-8]\d\)?[-\.\s]?[2-9]\d{2}[-\.\s]?\d{4}'
 text = '(323)4567890'
 patternObj = re.compile(pattern2)
 result = patternObj.findall(text)
 print(result)

对URL地址进行匹配是一个相当困难的任务，其复杂性取决于你想获得多么精确的匹配结果。
最简单的情况下URL应该匹配的内容有：协议名(http|https)，一个主机名，一个可选的端口号，一个文件路径。

import re

URLpattern = r'((http|https)://\w+\.\w+\.\w+)'
text = 'http://www.baidu.com https://www.taobao.com ftp://www.westos.com'
patternObj = re.compile(URLpattern)
result = patternObj.findall(text)
print(result)

在这里插入图片描述

re模块

正则表达式使用对特殊字符进行转义，所以如果我们要使用原始字符串，只需加一个 r 前缀， e.g. r’chuanzhiboke\t.\tpython’

re 模块一般使用步骤

使用 compile() 函数将正则表达式的字符串形式编译为一个 Pattern 对象
通过 Pattern 对象提供的一系列方法对文本进行匹配查找，获得匹配结果，一个 Match 对象。
最后使用 Match 对象提供的属性和方法获得信息，根据需要进行其他的操作

compile 函数：
compile 函数用于编译正则表达式，生成一个 Pattern 对象，它的一般使用形式如下：在这里插入图片描述
Pattern 对象
正则表达式编译成 Pattern 对象，可以利用 pattern 的一系列方法对文本进行匹配查找了。
Pattern 对象的一些常用方法主要有：
match 方法：从起始位置开始查找，一次匹配
search 方法：从任何位置开始查找，一次匹配
findall 方法：全部匹配，返回列表
finditer 方法：全部匹配，返回迭代器
split 方法：分割字符串，返回列表
sub 方法：替换

match 方法
match 方法用于查找字符串的头部（也可以指定起始位置），它是一次匹配，只要找到了一个匹配的结果就返回，而不是查找所有匹配的结果。它的一般使用形式如下：
string 待匹配的字符串
pos 字符串的起始位置，默认值是 0
endpos 字符串的终点位置，默认值是 len (字符串长度)

match对象
group([group1, …]) 方法用于获得一个或多个分组匹配的字符串，当要获得整个匹配的子串时，可直接使用 group() 或 group(0)；

start([group]) 方法用于获取分组匹配的子串在整个字符串中的起始位置（子串第一个字符的索引），参数默认值为 0；

end([group]) 方法用于获取分组匹配的子串在整个字符串中的结束位置（子串最后一个字符的索引+1），参数默认值为 0；

span([group]) 方法返回 (start(group), end(group))。

search 方法
search 方法用于查找字符串的任何位置，它也是一次匹配，只要找到了一个匹配的结果就返回，而不是查找所有匹配的结果，它的一般使用形式如下：
在这里插入图片描述
当匹配成功时，返回一个 Match 对象，如果没有匹配上，则返回 None。

findall 方法与finditer 方法
在这里插入图片描述

split 方法
split 方法按照能够匹配的子串将字符串分割后返回列表，它的使用形式如下：

西楚霸王刘波

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
爬虫基础———正则表达式

文章目录正则表达式简介正则匹配规则：re模块正则表达式简介为什么要学正则表达式？实际上爬虫一共就四个主要步骤：明确目标（要知道你准备在哪个范围或者网站去搜索）爬（将所有网站的内容全部爬下来）取（去掉对我们没用的数据）处理数据（按照我们想要的方式存储和使用）什么是正则表达式？正则表达是，又称规则表达式，通常被用来检索，替换那些符合规则的文本。正则表达式是对字符串操作的一...
复制链接

扫一扫