【Python网络爬虫笔记】7-网络爬虫的搜索工具re模块

原创

已于 2024-12-02 11:39:54 修改 · 1.2k 阅读

CC 4.0 BY-SA版权

文章标签：

于 2024-12-02 11:36:23 首次发布

一、网络爬虫中的正则表达式和re模块

定位特定数据
- 在网页的HTML或其他文本数据中，目标数据往往混杂在大量无关信息中。例如，在一个电影网站上，要提取某部电影的评分，评分数据可能被包裹在特定的HTML标签内。
- 正则表达式可以精确地定位这些数据。比如，使用<span class="rating_num">(.*?)</span>这个正则表达式，可以在HTML中找到电影评分所在的<span>标签，并提取其中的评分数值。
过滤无关信息
- 网络爬虫抓取的网页内容包含大量不需要的信息，如导航栏、广告、版权声明等。正则表达式可以帮助过滤掉这些无关数据。
- 例如，要从一个包含大量新闻文章的网页中提取正文内容，通过分析网页结构，发现正文内容在<div class="article - content">标签内，可以使用正则表达式<div class="article - content">(.*?)</div>来提取正文，过滤掉其他非正文的HTML元素。

应对多样化的网页结构
- 不同网站的网页结构各异，甚至同一网站的不同页面可能也有不同的结构。正则表达式具有很强的灵活性，能够适应这种多样性。
- 例如，在一个电商网站上，商品价格可能在不同页面以不同的HTML格式呈现。有的可能是<span id="price">19.99</span>，有的可能是<div class="product - price">19.99</div>。通过编写灵活的正则表达式，如<(span|div).*?(id="price"|class="product - price")>(.*?)</(span|div)>，可以适应这种结构变化来提取价格信息。
处理嵌套结构
- 网页中的HTML标签常常存在嵌套关系，正则表达式可以处理一定程度的嵌套数据提取。
- 例如，要从一个包含评论列表的网页中提取每条评论及其回复。评论可能在<div class="comment">标签内，回复在<div class="reply">标签内且嵌套在评论标签下。通过合适的正则表达式，可以逐层提取这些嵌套的数据。

快速匹配
- 正则表达式引擎经过优化，能够在大量文本中快速找到匹配的模式。在处理大型网页或大量网页时，这种快速匹配能力尤为重要。
- 例如，在爬取一个包含数千条产品信息的电商网站时，使用正则表达式可以快速扫描每个产品页面，提取诸如产品名称、价格、销量等关键信息，而不需要逐个字符去查找和判断。
减少代码复杂度
- 相较于手动编写复杂的字符串处理逻辑，使用正则表达式可以用简洁的模式表达复杂的匹配规则，从而减少代码量和复杂度。
- 比如，要从一个文本中提取所有的电话号码，手动编写代码可能需要多层循环和条件判断。而使用正则表达式d{3}-d{4}-d{4}（假设电话号码格式为XXX - XXXX - XXXX），可以用很少的代码实现相同的功能。

在Python中，re模块提供了对正则表达式操作的支持，包括匹配、搜索、替换、分割等功能，使得在网络爬虫中方便地运用正则表达式来处理抓取到的数据。

在线正则表达式工具网站：在线正则表达式测试
在这里插入图片描述

正则表达式（Regular Expression）是一种用于描述、匹配和操作文本字符串的强大工具。它由一系列字符和操作符组成，可以定义一个搜索模式，用于在文本中查找、替换或验证符合特定模式的字符串。正则表达式在文本处理、数据验证、搜索引擎、编程语言等多个领域都有广泛应用。

200万优质内容无限畅学