利用Python把github上非常实用的数据全部抓取下来！留给自己备用

最新推荐文章于 2022-11-26 20:30:52 发布

weixin_40581980

最新推荐文章于 2022-11-26 20:30:52 发布

阅读量5.6k

点赞数

摘要：这是我根据这个流程实现的代码，网址：LiuRoy/github_spider 递归实现运行结果因为每个请求延时很高，爬虫运行效率很慢，访问了几千个请求之后拿到了部分数据，这是按照查看数降序排列的python项目：这是按粉丝数降序排列的用户列表运行缺陷作为一个有追求的程序员，当然不能因为一点小成就满足，总结一下递归实现的几个缺陷：因为是深度优先，当整个用户图很大的时候，单机递归可能造成内存溢出从而使程序崩溃，只能在单机短时间运行。

利用Python把github上非常实用的数据全部抓取下来！留给自己备用

利用Python把github上非常实用的数据全部抓取下来！留给自己备用

这是我根据这个流程实现的代码，网址：LiuRoy/github_spider

递归实现

利用Python把github上非常实用的数据全部抓取下来！留给自己备用

运行结果

因为每个请求延时很高，爬虫运行效率很慢，访问了几千个请求之后拿到了部分数据，这是按照查看数降序排列的python项目：

利用Python把github上非常实用的数据全部抓取下来！留给自己备用

这是按粉丝数降序排列的用户列表

利用Python把github上非常实用的数据全部抓取下来！留给自己备用

运行缺陷

作为一个有追求的程序员，当然不能因为一点小成就满足，总结一下递归实现的几个缺陷：

因为是深度优先，当整个用户图很大的时候，单机递归可能造成内存溢出从而使程序崩溃，只能在单机短时间运行。单个请求延时过长，数据下载速度太慢。

针对一段时间内访问失败的链接没有重试机制，存在数据丢失的可能。

异步优化

利用Python把github上非常实用的数据全部抓取下来！留给自己备用

队列实现

实现原理

采取广度优先的遍历的方式，可以把要访问的网址存放在队列中，再套用生产者消费者的模式就可以很容易的实现多并发，从而解决上面的问题2。如果某段时间内一直失败，只需要将数据再仍会队列就可以彻底解决问题3。不仅如此，这种方式还可以支持中断后继续运行，程序流程图如下：

利用Python把github上非常实用的数据全部抓取下来！留给自己备用

运行程序

为了实现多级部署（虽然我就只有一台机器），消息队列使用了rabbitmq，需要创建名为github，类型是direct的exchange，然后创建四个名称分别为user, repo, follower, following的队列，详细的绑定关系见下图：

利用Python把github上非常实用的数据全部抓取下来！留给自己备用

利用Python把github上非常实用的数据全部抓取下来！留给自己备用

weixin_40581980

关注

0
点赞
踩
7

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。