不会Python爬虫？教你一个通用爬虫思路一天轻松抓取100万张网页

最新推荐文章于 2024-04-02 10:14:05 发布

puww556

最新推荐文章于 2024-04-02 10:14:05 发布

阅读量748

点赞数

分类专栏：科技文章标签：大数据

本文链接：https://blog.csdn.net/guangxiamu/article/details/109385860

版权

本文分享了如何使用Python进行高效爬虫，针对抓取大量网页时遇到的硬盘存储、内存管理、URL去重和反抓取策略等问题提出解决方案，包括硬盘压缩、BloomFilter、多线程和ADSL拨号等技术，旨在实现单台机器抓取上百万网页的性能优化。

摘要由CSDN通过智能技术生成

如何让Python爬虫一天抓取100万张网页

前一两年抓过某工商信息网站，几三周时间大约抓了过千万多万张页面。那时由于公司没啥经费，报销又拖得很久，不想花钱在很多机器和带宽上，所以当时花了较多精力研究如何让一台爬虫机器达到抓取极限。

本篇偏爬虫技术细节，先周知。

如何让Python爬虫一天抓取100万张网页

Python爬虫这两年貌似成为了一项必备技能，无论是搞技术的，做产品的，数据分析的，金融的，初创公司做冷启动的，都想去抓点数据回来玩玩。这里面绝大多数一共都只抓几万或几十万条数据，这个数量级其实大可不必写爬虫，使用 chrome 插件 web scraper 或者让 selenium 驱动 chrome 就好了，会为你节省很多分析网页结构或研究如何登陆的时间。

本篇只关注如何让爬虫的抓取性能最大化上，没有使用scrapy等爬虫框架，就是多线程+Python requests库搞定。

对一个网站定向抓取几十万张页面一般只用解决访问频率限制问题就好了。对机器内存，硬盘空间，URL去重，网络性能，抓取间隙时间调优一般都不会在意。如果要设计一个单台每天抓取上百万张网页，共有一亿张页面的网站时，访问频率限制问题就不是最棘手的问题了，上述每一项都要很好解决才行。硬盘存储，内存，网络性能等问题我们一项项来拆解。

一、优化硬盘存储

所以千万级网页的抓取是需要先设计的，先来做一个计算题。共要抓取一亿张页面，一般一张网页的大小是400KB左右，一亿张网页就是1亿X200KB=36TB 。这么大的存储需求，一般的电脑和硬盘都是没法存储的。所以肯定要对网页做压缩后存储，可以用zlib压缩，也可以用压缩率更好的bz2或pylzma 。

但是这样还不够，我们拿天眼查的网页来举例。天眼查一张公司详情页的大小是700KB 。

如何让Python爬虫一天抓取100万张网页

对这张网页zlib压缩后是100KB。

如何让Python爬虫一天抓取100万张网页

最低0.47元/天解锁文章

puww556

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
不会Python爬虫？教你一个通用爬虫思路一天轻松抓取100万张网页

前一两年抓过某工商信息网站，几三周时间大约抓了过千万多万张页面。那时由于公司没啥经费，报销又拖得很久，不想花钱在很多机器和带宽上，所以当时花了较多精力研究如何让一台爬虫机器达到抓取极限。本篇偏爬虫技术细节，先周知。Python爬虫这两年貌似成为了一项必备技能，无论是搞技术的，做产品的，数据分析的，金融的，初创公司做冷启动的，都想去抓点数据回来玩玩。这里面绝大多数一共都只抓几万或几十万条数据，这个数量级其实大可不必写爬虫，使用 chrome 插件 web scraper 或者...
复制链接

扫一扫