python 爬取分页内容_Python爬虫：如何爬取分页数据？

最新推荐文章于 2024-05-09 18:40:13 发布

石头跑跑

最新推荐文章于 2024-05-09 18:40:13 发布

阅读量3.3k

点赞数

文章标签： python 爬取分页内容

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_29256771/article/details/113312979

版权

爬取对象：

有融网理财项目列表页【履约中】状态下的前10页数据，地址：https://www.yrw.com/products/list-all-all-performance-1-createTimeDesc-1.html

编程思路：

1. 寻找分页地址的变动规律 2. 解析网页，获取内容，放入自定义函数中 3. 调用函数，输出分页内容

详细解说：

1. 首先插入用到的库：BeautifulSoup、requests

from bs4 import BeautifulSoup

import requests

2. 观察地址的变化规律，可以看到，每切换一页时，后面“createTimeDesc-1.html”中的数字1会随着页面的变动而变动，此时我们将地址存放进列表中，后面用format()和for循环来实现多个地址的存储。

urls = ['https://www.yrw.com/products/list-direct-all-performance-1-createTimeDesc-{}.html'.format(str(i))foriinrange(1,11)]

print(urls)

此时可以先print下，看地址是否正确，这里range(1,11)是前10个页面的地址。

3. 接下来定义解析函数，参数data的初始值为空。函数内用到的内容和上一篇文章中讲到的相同。先请求urls，然后用BeautifulSoup解析，筛选我们想要的项目标题titles的位置，实现输出。

最低0.47元/天解锁文章

关注

0
点赞
踩
5

收藏

觉得还不错? 一键收藏
0
评论
python 爬取分页内容_Python爬虫：如何爬取分页数据？

爬取对象：有融网理财项目列表页【履约中】状态下的前10页数据，地址：https://www.yrw.com/products/list-all-all-performance-1-createTimeDesc-1.html编程思路：1. 寻找分页地址的变动规律 2. 解析网页，获取内容，放入自定义函数中 3. 调用函数，输出分页内容详细解说：1. 首先插入用到的库：BeautifulSoup、re...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。