
Beautiful Soup
简单来说,Beautiful Soup 是 python 的一个库,最主要的功能是从网页抓取数据。官方解释如下:
Beautiful Soup 提供一些简单的、python 式的函数用来处理导航、搜索、修改分析树等功能。它是一个工具箱,通过解析文档为用户提供需要抓取的数据,因为简单,所以不需要多少代码就可以写出一个完整的应用程序。 Beautiful Soup 自动将输入文档转换为 Unicode 编码,输出文档转换为 utf-8 编码。你不需要考虑编码方式,除非文档没有指定一个编码方式,这时,Beautiful Soup 就不能自动识别编码方式了。然后,你仅仅需要说明一下原始编码方式就可以了。 Beautiful Soup 已成为和 lxml、html6lib 一样出色的 python 解释器,为用户灵活地提供不同的解析策略或强劲的速度。
关于这个库的安装以及anaconda的环境配置,就自行百度就可以了,这里就不详细介绍~
这里放一个官方链接
废话不多说,我们来看一下吧~
这里先介绍一个可以用于测试这个库的一个HTML页面把:
https://www.crummy.com/software/BeautifulSoup/
我们可以把这个页面保存下来,也可以用源代码
如何获得源代码呢?
第一种方法:鼠标右键,显示源代码
第二种:使用requests库获取源代码

本文介绍了Python的Beautiful Soup库,主要用于网页数据抓取。Beautiful Soup自动处理编码问题,提供导航和搜索功能。文章讲解了Beautiful Soup库的理解、Tag标签的概念及其属性,以及HTML基本格式和不同类型的遍历方法。最后,讨论了如何通过prettify()方法使HTML输出更易读。
最低0.47元/天 解锁文章
56万+

被折叠的 条评论
为什么被折叠?



