python爬虫微博关键字_微博关键词爬虫——基于requests和aiohttp

最新推荐文章于 2024-06-26 22:22:01 发布

weixin_39556474

最新推荐文章于 2024-06-26 22:22:01 发布

阅读量2k

点赞数 1

文章标签： python爬虫微博关键字

requests库是python爬虫中最常见的库，与内置的urllib库相比，它更加简洁高效，是每一个接触爬虫者都务必要掌握的基础；但它也是有缺点的，就是不支持异步操作，虽然可以通过多线程来解决，但当需要发送大量请求时，创建大量的线程会浪费过多的资源；此时出现了一个新的库aiohttp，它是支持异步操作的，可以在一个线程中，通过异步多任务来实现快速发送请求，提高效率。这次，我基于这两个库，做一个高效的微博关键词爬虫，源码在文章的末尾。

首先，我是从微博的移动端地址入手，发现它是ajsx请求，请求参数中，除页码外，其他都是常量，所以要实现多页请求，直接将页码当作参数发送即可。但是页面返回的json数据并没有直接标明总页数，所以需要自己计算。进一步分析，发现数据中包含了微博的总条数和每一页的条数，这就是突破口，对它进行简单的运算就可以拿到总页码。此处只需要发送一次请求，就可以获取到信息，所以这里采用的是requests。

defget_page():"""先用requests构造请求，解析出关键词搜索出来的微博总页数

:return: 返回每次请求需要的data参数"""data_list=[]

data={'containerid': '100103type=1&q={}'.format(kw),'page_type': 'searchall'}

resp= requests.get(url=url, headers=headers, params=data)

total_page= resp.json()['data']['cardlistInfo']['total'] #微博总数

#一页有10条微博，用总数对10整除，余数为0则页码为总数/10，余数不为0则页码为(总数/10)+1

if total_page % 10 ==0:

page_num= int(total_page / 10)else:

page_num= int(total_page / 10) + 1

#页码为1，data为当前data，页码不为1，通过for循环构建每一页的data参数

if page_num == 1:

data_list.append(data)returndata_listelse:for i in range(1, page_num + 1):

data['page'] =i

data_list.append(copy.deepcopy(data))

最低0.47元/天解锁文章

weixin_39556474

关注

1
点赞
踩
9

收藏

觉得还不错? 一键收藏
0
评论
python爬虫微博关键字_微博关键词爬虫——基于requests和aiohttp

requests库是python爬虫中最常见的库，与内置的urllib库相比，它更加简洁高效，是每一个接触爬虫者都务必要掌握的基础；但它也是有缺点的，就是不支持异步操作，虽然可以通过多线程来解决，但当需要发送大量请求时，创建大量的线程会浪费过多的资源；此时出现了一个新的库aiohttp，它是支持异步操作的，可以在一个线程中，通过异步多任务来实现快速发送请求，提高效率。这次，我基于这两个库，做一个高...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。