python爬虫beautifulsoup爬当当网_python爬虫07 | 有了 BeautifulSoup ，妈妈再也不用担心我的正则表达式了...

最新推荐文章于 2023-02-03 11:49:48 发布

weixin_39981041

最新推荐文章于 2023-02-03 11:49:48 发布

阅读量132

点赞数

文章标签： python爬虫beautifulsoup爬当当网

本文链接：https://blog.csdn.net/weixin_39981041/article/details/111967391

版权

这篇博客介绍了Python网页解析库BeautifulSoup的使用，包括安装、基本操作和常用方法，如获取标题、内容、超链接等，展示了如何在不使用正则表达式的情况下便捷地提取HTML数据。

摘要由CSDN通过智能技术生成

我们上次做了

有些朋友觉得

利用正则表达式去提取信息

太特么麻烦了

有没有什么别的方式

更方便过滤我们想要的内容啊

emmmm

你还别说

还真有

有一个高效的网页解析库

它的名字叫做

BeautifulSoup

那可是

它

是一个可以从 HTML 或 XML 文件中提取数据的 Python 库

那么这么玩呢

...

接下来就是

学习python的正确姿势

首先我们要安装一下这个库

pip install beautifulsoup4

beautifulsoup支持不同的解析器

比如

对 HTML 的解析

对 XML 的解析

对 HTML5 的解析

你看

一般情况下

我们用的比较多的是 lxml 解析器

我们先来使用一个例子

让你体验一下

beautifulsoup 的一些常用的方法

可流弊了呢

比如我们有这样一段 HTML 代码

html_doc = """

学习python的正确姿势

小帅b的故事

有一天，小帅b想给大家讲两个笑话

一个笑话长,

一个笑话短 ,

他问大家，想听长的还是短的？

...

"""

在不使用 re 来进行正则表达式的情况下

如何快速获取到我们想要的内容呢？

先安装一下

pip install beautifulsoup4

pip install lxml

接着将 html 的源代码传给 BeautifulSoup

soup = BeautifulSoup(html_doc,'lxml')

此时此刻

就不需要自己写正则匹配了

我们要做的就是从这个对象直接获取我们要的内容

获取标题的内容

print(soup.title.string)

#学习python的正确姿势

获取 p 标签里面的内容

print(soup.p.string)

#小帅b的故事

获取 title 的父级标签

print(soup.title.parent.name)

#head

获取超链接

print(soup.a)

#一个笑话长

获取所有超链接

print(soup.find_all('a'))

#[一个笑话长, 一个笑话短]

获取 id 为 link2 的超链接

print(soup.find(id="link2"))

#一个笑话短

获取网页中所有的内容

print(soup.get_text())

# 学习python的正确姿势

小帅b的故事

有一天，小帅b想给大家讲两个笑话

一个笑话长,

一个笑话短 ,

他问大家，想听长的还是短的？

...

除了find方法之外

如果你对css比较熟悉

也可以使用 select 方法

soup = BeautifulSoup(html_doc,'lxml')

print(soup.select("title"))

print(soup.select("body a"))

print(soup.select("p > #link1"))

以上就是 BeautifulSoup 常用的方法

想进一步了解可以到这

https://www.crummy.com/software/BeautifulSoup/bs4/doc/

有了它

妈妈再也不用担心我的正则表达式了

下次还有人这样问你

你可以傲娇的告诉他

睡得着

本篇完

再见

近期文章

扫一扫

学习 Python 没烦恼

好看的人都点了

weixin_39981041

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫