beautifulsoup爬虫快速入门一基础知识

最新推荐文章于 2024-03-19 20:34:59 发布

斩落千山

最新推荐文章于 2024-03-19 20:34:59 发布

阅读量324

点赞数 1

分类专栏：工程师必会内容

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/teachskyLY/article/details/97397570

版权

工程师必会内容专栏收录该内容

12 篇文章

订阅专栏

主要涉及到的知识点
这里针对的是数据以HTML返回的形式
beautifulsoup、lxml的使用
首先这里需要请求到一个网页地址，之后用beautifulsoup解析网页

requestsAPI = request.get(url)
bs = BeautifulSoup(requestsAPI.content,'lxml')

获取的是多个元素find_all

many = bs.find_all('div',class_ = 'pcb')

获取一个元素find

one = bs[0].find('td')

找到p id = 'number’下面的所有td

findTd = bs.find('p',id = 'number').find_all('td')

找到一个标签下的属性

find = bs[0].find('img')['file']

查看标签内包含的内容

bs[0].find_all('strong')[3].text

Beautiful Soup 4.2.0 文档
https://www.crummy.com/software/BeautifulSoup/bs4/doc.zh/

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。