【教程】BeautifulSoup中使用正则表达式去搜索多种可能的关键字

【背景】

折腾过基本的BeautifulSoup的人,知道,可以通过指定对应的name和attrs去搜索,特定的名字和属性,以找到所需要的部分的html代码。

但是,有时候,会遇到,对于要处理的内容中,其name或attr的值,有多种可能,尤其是符合某一规律,此时,就无法写成固定的值了。

所以,就可以借助正则表达式来解决此问题。

【举例说明】

比如,原先教程:

【教程】Python中第三方的用于解析HTML的库:BeautifulSoup

中的html:

<div class="icon_col">
        <h1 class="h1user">crifan</h1>
</div>

对应的BeautifulSoup代码如下:

h1userSoup = soup.find(name="h1", attrs={"class":"h1user"});

而如果html是这种:

<div class="icon_col">
        <h1 class="h1user">crifan</h1>
        <h1 class="h1user test1">crifan 123</h1>
        <h1 class="h1user test2">crifan 456</h1>
</div>

那么想要一次性地找到所有的,符合条件的h1的部分的代码,则之前的写法,就只能找到单个的class="h1user"的部分,剩下的两个

class="h1user test1"

class="h1user test2"

就找不到了。

那么,此时,就可以用到,BeautifulSoup中非常好用的,非常强大的功能:

attrs中支持正则表达式的写法

了。

就可以写成:

h1userSoupList = soup.findAll(name="h1", attrs={"class":re.compile(r"h1user(\s\w+)?")});

就可以一次性地,找到:

class="h1user"

class="h1user test1"

class="h1user test2"

了。

 

  • 1
    点赞
  • 6
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
BeautifulSoup,您可以使用正则表达式搜索和匹配标签、属性和标签内容。以下是一些示例代码: ```python from bs4 import BeautifulSoup import re # 假设您已经获取到HTML文档的内容,存储在变量html html = """ <html> <head> <title>网页标题</title> </head> <body> <h1>这是一个标题</h1> <p>这是一个段落</p> <a href="https://www.example.com">这是一个链接</a> <img src="image.jpg" alt="图片"> </body> </html> """ # 创建BeautifulSoup对象,解析HTML soup = BeautifulSoup(html, 'html.parser') # 使用正则表达式搜索标签 tags = soup.find_all(re.compile('^h\d$')) # 匹配所有h1到h9标签 for tag in tags: print(tag.text) # 使用正则表达式搜索属性值 links = soup.find_all('a', href=re.compile('example')) # 匹配href属性包含'example'的a标签 for link in links: print(link['href']) # 使用正则表达式搜索标签内容 pattern = re.compile(r'图片') imgs = soup.find_all(text=pattern) # 匹配所有含有'图片'的文本内容 for img in imgs: print(img) ``` 在上述代码,我们使用了`re.compile()`函数创建了一个正则表达式对象。然后,我们可以在`find_all()`方法使用该对象来进行搜索。在第一个示例,我们使用正则表达式`^h\d$`来匹配所有h1到h9标签。在第二个示例,我们使用正则表达式`example`来匹配href属性包含'example'的a标签。在第三个示例,我们使用正则表达式`图片`来匹配所有含有'图片'的文本内容。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值