【python教程入门学习】如何提高爬虫速度？_python 除了上方所述的基于三个程来为爬虫进行提速之外

2401_84586689

于 2024-04-26 23:53:58 发布

阅读量530

点赞数 18

分类专栏： 2024年程序员学习文章标签： python

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/2401_84586689/article/details/138234288

版权

2024年程序员学习专栏收录该内容

5 篇文章 0 订阅

订阅专栏

今天在浏览知乎时，发现一个有趣的问题：

如何优化 Python 爬虫的速度？

他的问题描述是：

目前在写一个 Python 爬虫，单线程 urllib 感觉过于慢了，达不到数据量的要求（十万级页面）。求问有哪些可以提高爬取效率的方法？

这个问题还蛮多人关注的，但是回答的人却不多。

我今天就来尝试着回答一下这个问题。

程序提速这个问题其实解决方案就摆在那里，要么通过并发来提高单位时间内处理的工作量，要么从程序本身去找提效点，比如爬取的数据用gzip传输、提高处理数据的速度等。最后，如果你的时间不是很紧张，并且又想快速的python提高，最重要的是不怕吃苦，建议你可以微♥信：762459510 ，那个真的很不错，很多人进步都很快，需要你不怕吃苦哦！大家可以去添加上看一下~

我会分别从几种常见的并发方法去做同一件事情，从而比较处理效率。

简单版本爬虫

我们先来一个简单的爬虫，看看单线程处理会花费多少时间？

我们用一个爬虫的测试网站，测试爬取100次，用时是54.86秒。

多线程版本爬虫

下面我们将上面的程序改为多线程版本：

我们可以看到，用上多线程之后，速度提高了68倍。其实用这种方式的话，由于我们并发操作，所以跑100次跟跑一次的时间基本是一致的。这只是一个简单的例子，实际情况中我们不可能无限制地增加线程数。

多进程版本爬虫

除了多线程之外，我们还可以使用多进程来提高爬虫速度：

我们可以看到多进程处理的时间是多线程的10倍，比单线程版本快7倍。

协程版本爬虫

我们将程序改为使用 aiohttp 来实现，看看效率如何：

我们可以看到使用这种方式实现，比单线程版本快90倍，比多线程还快。

结论

通过上面的程序对比，我们可以看到，对于多任务爬虫来说，多线程、多进程、协程这几种方式处理效率的排序为：aiohttp > 多线程 > 多进程。因此，对于简单的爬虫任务，如果想要提高效率，可以考虑使用协程。但是同时也要注意，这里只是简单的示例，实际运用中，我们一般会用线程池、进程池、协程池去操作。最后，如果你的时间不是很紧张，并且又想快速的python提高，最重要的是不怕吃苦，建议你可以微♥信：762459510 ，那个真的很不错，很多人进步都很快，需要你不怕吃苦哦！大家可以去添加上看一下~

这就是问题的答案了吗？

对于一个严谨的程序员来说，当然不是，实际上还有一些优化的库，例如grequests，可以从请求上解决并发问题。实际的处理过程中，肯定还有其他的优化点，这里只是从最常见的几种并发方式去比较而已，应付简单爬虫还是可以的，其他的方式欢迎大家在评论区留言探讨。

文末有福利领取哦~

👉一、Python所有方向的学习路线

Python所有方向的技术点做的整理，形成各个领域的知识点汇总，它的用处就在于，你可以按照上面的知识点去找对应的学习资源，保证自己学得较为全面。

👉二、Python必备开发工具

👉三、Python视频合集

观看零基础学习视频，看视频学习是最快捷也是最有效果的方式，跟着视频中老师的思路，从基础到深入，还是很容易入门的。

👉 四、实战案例

光学理论是没用的，要学会跟着一起敲，要动手实操，才能将自己的所学运用到实际当中去，这时候可以搞点实战案例来学习。（文末领读者福利）

👉五、Python练习题

检查学习结果。

👉六、面试资料

我们学习Python必然是为了找到高薪的工作，下面这些面试题是来自阿里、腾讯、字节等一线互联网大厂最新的面试资料，并且有阿里大佬给出了权威的解答，刷完这一套面试资料相信大家都能找到满意的工作。

👉因篇幅有限，仅展示部分资料，这份完整版的Python全套学习资料已经上传

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化学习资料的朋友，可以戳这里无偿获取

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！

关注

18
点赞
踩
20

收藏

觉得还不错? 一键收藏
2
评论
【python教程入门学习】如何提高爬虫速度？_python 除了上方所述的基于三个程来为爬虫进行提速之外

今天在浏览知乎时，发现一个有趣的问题：如何优化 Python 爬虫的速度？他的问题描述是：目前在写一个 Python 爬虫，单线程 urllib 感觉过于慢了，达不到数据量的要求（十万级页面）。求问有哪些可以提高爬取效率的方法？这个问题还蛮多人关注的，但是回答的人却不多。我今天就来尝试着回答一下这个问题。程序提速这个问题其实解决方案就摆在那里，要么通过并发来提高单位时间内处理的工作量，要么从程序本身去找提效点，比如爬取的数据用gzip传输、提高处理数据的速度等。
复制链接

扫一扫

专栏目录

评论 2

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。