【教程】BeautifulSoup中使用正则表达式去搜索多种可能的关键字

转载 2015年07月08日 16:43:10

【背景】

折腾过基本的BeautifulSoup的人,知道,可以通过指定对应的name和attrs去搜索,特定的名字和属性,以找到所需要的部分的html代码。

但是,有时候,会遇到,对于要处理的内容中,其name或attr的值,有多种可能,尤其是符合某一规律,此时,就无法写成固定的值了。

所以,就可以借助正则表达式来解决此问题。

【举例说明】

比如,原先教程:

【教程】Python中第三方的用于解析HTML的库:BeautifulSoup

中的html:

<div class="icon_col">
        <h1 class="h1user">crifan</h1>
</div>

对应的BeautifulSoup代码如下:

h1userSoup = soup.find(name="h1", attrs={"class":"h1user"});

而如果html是这种:

<div class="icon_col">
        <h1 class="h1user">crifan</h1>
        <h1 class="h1user test1">crifan 123</h1>
        <h1 class="h1user test2">crifan 456</h1>
</div>

那么想要一次性地找到所有的,符合条件的h1的部分的代码,则之前的写法,就只能找到单个的class="h1user"的部分,剩下的两个

class="h1user test1"

class="h1user test2"

就找不到了。

那么,此时,就可以用到,BeautifulSoup中非常好用的,非常强大的功能:

attrs中支持正则表达式的写法

了。

就可以写成:

h1userSoupList = soup.findAll(name="h1", attrs={"class":re.compile(r"h1user(\s\w+)?")});

就可以一次性地,找到:

class="h1user"

class="h1user test1"

class="h1user test2"

了。

 

BeautifulSoup 提取某个tag标签里面的内容

用的版本是BeautifulSoup4,用起来的确要比 re 好用一些,不用一个个的去写正则表达式,这样还是挺方便的。 比如我要获取高匿代理IP页面上的IP和端口,网址这里:点击打开链接,它的组织方式...
  • Enter_
  • Enter_
  • 2016年08月19日 00:49
  • 21892

Learn Beautiful Soup(3)——使用Beautiful Soup进行查找

爬虫抓取信息
  • abclixu123
  • abclixu123
  • 2014年10月02日 20:15
  • 61062

BeautifulSoup中使用正则表达式re

在学习BeautifulSoup过程中,我们肯定都遇到过这种情况,我们在查找某些具有特殊格式的标签时候 头疼,举例说一下:我现在要去爬取www.baidu.com首页中的链接并且输出。在爬取的过程中你...
  • Winterto1990
  • Winterto1990
  • 2015年08月22日 12:26
  • 6531

Python爬虫实战一之使用Beautiful Soup抓取‘谣言百科’的分类内容

Beautiful Soup 功能简介    Beautiful Soup 是一个可以从HTML或XML文件中提取数据的Python库.它能够通过你喜欢的转换器实现惯用的文档导航,查找,修改文档的方...
  • xianjie0318
  • xianjie0318
  • 2017年07月15日 14:12
  • 325

BeautifulSoup基本用法总结

BeautifulSoup是Python的一个库,最主要的功能就是从网页爬取我们需要的数据。BeautifulSoup将html解析为对象进行处理,全部页面转变为字典或者数组,相对于正则表达式的方式,...
  • kikaylee
  • kikaylee
  • 2017年02月24日 15:07
  • 3632

Python中Beautiful Soup库详细教程

Python中Beautiful Soup库详细教程
  • baidu_22713341
  • baidu_22713341
  • 2015年09月23日 13:21
  • 946

关键词变红--正则表达式

搜索 就是我在搜索框里面就是个关键字然后点击搜索然后它会出现对应的标题内容标题内容这样的,可是下去然后我需要,如果说我这个关键字的标题或者内容中有出现我就把它显示出来,但是我...
  • qq_26684469
  • qq_26684469
  • 2016年04月09日 02:30
  • 1037

网络爬虫之BeautifulSoup入门(四)

带更多参数的find方法 官方文档给出的find方法的参数如下:find( name , attrs , recursive , string , **kwargs ),总体来看和find_all方...
  • yf999573
  • yf999573
  • 2016年12月18日 20:52
  • 205

python3 beautifulsoup 检测是否存在children 元素

官方的提示是说 x.childrens 或 x.contents ,但是会将回车 换行给包含进来。如果直接用x.find_all() 遇到 table 会导致报错,因为没有next_elements ...
  • default7
  • default7
  • 2017年08月18日 23:27
  • 622

windows 正则表达式 工具 PowerGREP

POWERGREP, 号称“The Most Powerful GREP Tool for Windows”,商业网站下载地址:http://www.powergrep.com/  点击可以看大图。另...
  • phlexii
  • phlexii
  • 2010年06月26日 18:37
  • 2591
内容举报
返回顶部
收藏助手
不良信息举报
您举报文章:【教程】BeautifulSoup中使用正则表达式去搜索多种可能的关键字
举报原因:
原因补充:

(最多只允许输入30个字)