Python爬虫，一天抓取100万张网页的酷炫操作！

最新推荐文章于 2024-03-20 09:34:39 发布

Python老王

最新推荐文章于 2024-03-20 09:34:39 发布

阅读量751

点赞数

文章标签： Python Python爬虫后端编程语言网络爬虫

本文链接：https://blog.csdn.net/Pythonlaowan/article/details/100937403

版权

本文分享了如何利用Python爬虫在单机上实现一天抓取100万张网页的技巧，包括硬盘存储优化、内存管理与URL去重、反抓取策略以及网络性能调优。通过压缩网页、BloomFilter算法减少内存占用，结合adsl拨号应对访问限制，并探讨了多线程与超时设置的优化方法。

摘要由CSDN通过智能技术生成

前一两年抓过某工商信息网站，几三周时间大约抓了过千万多万张页面。那时由于公司没啥经费，报销又拖得很久，不想花钱在很多机器和带宽上，所以当时花了较多精力研究如何让一台爬虫机器达到抓取极限。

Python爬虫这两年貌似成为了一项必备技能，无论是搞技术的，做产品的，数据分析的，金融的，初创公司做冷启动的，都想去抓点数据回来玩玩。这里面绝大多数一共都只抓几万或几十万条数据，这个数量级其实大可不必写爬虫，使用 chrome 插件web scraper或者让selenium驱动 chrome 就好了，会为你节省很多分析网页结构或研究如何登陆的时间。

本篇只关注如何让爬虫的抓取性能最大化上，没有使用scrapy等爬虫框架，就是多线程+Python requests库搞定。

对一个网站定向抓取几十万张页面一般只用解决访问频率限制问题就好了。对机器内存，硬盘空间，URL去重，网络性能，抓取间隙时间调优一般都不会在意。如果要设计一个单台每天抓取上百万张网页，共有一亿张页面的网站时，访问频率限制问题就不是最棘手的问题了，上述每一项都要很好解决才行。硬盘存储，内存，网络性能等问题我们一项项来拆解。

一、优化硬盘存储

所以千万级网页的抓取是需要先设计的，先来做一个计算题。共要抓取一亿张页面，一般一张网页的大小是400KB左右，一亿张网页就是1亿X200KB=36TB 。这么大的存储需求，一般的电脑和硬盘都是没法存储的。所以肯定要对网页做压缩后存储，可以用zlib压缩，也可以用压缩率更好的bz2或pylzma 。

但是这样还不够，我们拿天眼查的网页来举例。天眼查一张公司详情页的大小是700KB 。