beautifulsoup4 bs4 find_all & find 函数解析

最新推荐文章于 2024-07-17 14:11:27 发布

YZXnuaa

最新推荐文章于 2024-07-17 14:11:27 发布

阅读量6.4k

点赞数 4

分类专栏： Python库

本文链接：https://blog.csdn.net/YZXnuaa/article/details/97002132

版权

本文介绍了BeautifulSoup4库中find_all和find函数的使用方法，包括通过属性名、属性值、正则表达式进行筛选，以及如何根据标签内容和位置来定位元素。还提到了.name、.attrs和.has等后缀函数的功能。

摘要由CSDN通过智能技术生成

假定soup是我们下载下来的网页的对象了

soup = BeautifulSoup(a, "html.parser")

# 第一种，直接将属性名作为参数名，但是有些属性不行，比如像a-b这样的属性
soup.find_all('p', id = 'p1') # 一般情况
soup.find_all('p', class_='p3') # class是保留字比较特殊，需要后面加一个_

# 最通用的方法
soup.find_all('p', attrs={'class':'p3'}) # 包含这个属性就算，而不是只有这个属性
soup.find_all('p', attrs={'class':'p3','id':'pp'}) # 使用多个属性匹配
soup.find_all('p', attrs={'class':'p3','id':False}) # 指定不能有某个属性
soup.find_all('p', attrs={'id':['p1','p2']}) # 属性值是p1或p2

# 正则表达式匹配
import re
soup.find_all('p', attrs={'id':re.compile('^p')}) # 使用正则表达式
soup.find_all('p', attrs={'class':True}) # 含有class属性即可