java 多线程爬虫_Java 多线程爬虫及分布式爬虫架构探索

最新推荐文章于 2023-07-22 13:45:58 发布

流心奶黄月饼

最新推荐文章于 2023-07-22 13:45:58 发布

阅读量98

点赞数

文章标签： java 多线程爬虫

本文链接：https://blog.csdn.net/weixin_30678347/article/details/114423941

版权

本文介绍了Java多线程爬虫的必要性和优势，强调了统一URL维护和URL去重的重要性。通过实例展示了如何使用LinkedBlockingQueue和HashSet实现多线程爬虫，同时对比了单线程爬虫的效率。此外，还简单探讨了分布式爬虫架构，提出在多机环境中利用Redis或MongoDB维护URL。

摘要由CSDN通过智能技术生成

这是 Java 爬虫系列博文的第五篇，在上一篇 Java 爬虫服务器被屏蔽，不要慌，咱们换一台服务器中，我们简单的聊反爬虫策略和反反爬虫方法，主要针对的是 IP 被封及其对应办法。前面几篇文章我们把爬虫相关的基本知识都讲的差不多啦。这一篇我们来聊一聊爬虫架构相关的内容。

前面几章内容我们的爬虫程序都是单线程，在我们调试爬虫程序的时候，单线程爬虫没什么问题，但是当我们在线上环境使用单线程爬虫程序去采集网页时，单线程就暴露出了两个致命的问题：

采集效率特别慢，单线程之间都是串行的，下一个执行动作需要等上一个执行完才能执行

对服务器的CUP等利用率不高，想想我们的服务器都是 8核16G，32G 的只跑一个线程会不会太浪费啦

线上环境不可能像我们本地测试一样，不在乎采集效率，只要能正确提取结果就行。在这个时间就是金钱的年代，不可能给你时间去慢慢的采集，所以单线程爬虫程序是行不通的，我们需要将单线程改成多线程的模式，来提升采集效率和提高计算机利用率。

多线程的爬虫程序设计比单线程就要复杂很多，但是与其他业务在高并发下要保证数据安全又不同，多线程爬虫在数据安全上到要求不是那么的高，因为每个页面都可以被看作是一个独立体。要做好多线程爬虫就必须做好两点：第一点就是统一的待采集 URL 维护，第二点就是 URL 的去重，下面我们简单的来聊一聊这两点。

维护待采集的 URL

多线程爬虫程序就不能像单线程那样，每个线程独自维护这自己的待采集 URL，如果这样的话，那么每个线程采集的网页将是一样的，你这就不是多线程采集啦，你这是将一个页面采集的多次。基于这个原因我们就需要将待采集的 URL 统一维护，每个线程从统一 URL 维护处领取采集 URL ，完成采集任务，如果在页面上发现新的 URL 链接则添加到统一 URL 维护的容器中。下面是几种适合用作统一 URL 维护的容器：

JDK 的安全队列，例如 LinkedBlockingQueue

高性能的 NoSQL，比如 Redis、Mongodb

MQ 消息中间件

URL 的去重

URL 的去重也是多线程采集的关键一步，因为如果不去重的话，那么我们将采集到大量重复的 URL，这样并没有提升我们的采集效率，比如一个分页的新闻列表，我们在采集第一页的时候可以得到 2、3、4、5 页的链接，在采集第二页的时候又会得到 1、3、4、5 页的链接，待采集的 URL 队列中将存在大量的列表页链接，这样就会重复采集甚至进入到一个死循环当中，所以就需要 URL 去重。URL 去重的方法就非常多啦，下面是几种常用的 URL 去重方式：

将 URL 保存到数据库进行去重，比如 redis、MongoDB

将 URL 放到哈希表中去重，例如 hashset

将 URL 经过 MD5 之后保存到哈希表中去重，相比于上面一种，能够节约空间

使用布隆过滤器(Bloom Filter)去

最低0.47元/天解锁文章

流心奶黄月饼

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
java 多线程爬虫_Java 多线程爬虫及分布式爬虫架构探索

这是 Java 爬虫系列博文的第五篇，在上一篇 Java 爬虫服务器被屏蔽，不要慌，咱们换一台服务器中，我们简单的聊反爬虫策略和反反爬虫方法，主要针对的是 IP 被封及其对应办法。前面几篇文章我们把爬虫相关的基本知识都讲的差不多啦。这一篇我们来聊一聊爬虫架构相关的内容。前面几章内容我们的爬虫程序都是单线程，在我们调试爬虫程序的时候，单线程爬虫没什么问题，但是当我们在线上环境使用单线程爬虫程序去采...
复制链接

扫一扫