python网络爬虫自学笔录4_Beautiful Soup解析库

本文介绍了Python的Beautiful Soup库,主要用于网页数据抓取。Beautiful Soup自动处理编码问题,提供导航和搜索功能。文章讲解了Beautiful Soup库的理解、Tag标签的概念及其属性,以及HTML基本格式和不同类型的遍历方法。最后,讨论了如何通过prettify()方法使HTML输出更易读。

在这里插入图片描述

Beautiful Soup

简单来说,Beautiful Soup 是 python 的一个库,最主要的功能是从网页抓取数据。官方解释如下:

Beautiful Soup 提供一些简单的、python 式的函数用来处理导航、搜索、修改分析树等功能。它是一个工具箱,通过解析文档为用户提供需要抓取的数据,因为简单,所以不需要多少代码就可以写出一个完整的应用程序。 Beautiful Soup 自动将输入文档转换为 Unicode 编码,输出文档转换为 utf-8 编码。你不需要考虑编码方式,除非文档没有指定一个编码方式,这时,Beautiful Soup 就不能自动识别编码方式了。然后,你仅仅需要说明一下原始编码方式就可以了。 Beautiful Soup 已成为和 lxml、html6lib 一样出色的 python 解释器,为用户灵活地提供不同的解析策略或强劲的速度。

关于这个库的安装以及anaconda的环境配置,就自行百度就可以了,这里就不详细介绍~
这里放一个官方链接

废话不多说,我们来看一下吧~

这里先介绍一个可以用于测试这个库的一个HTML页面把:

https://www.crummy.com/software/BeautifulSoup/

我们可以把这个页面保存下来,也可以用源代码
如何获得源代码呢?
第一种方法:鼠标右键,显示源代码
第二种:使用requests库获取源代码

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

行秋即离

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值