【面试题】爬虫的广度优先和深度优先

最新推荐文章于 2024-08-01 23:45:28 发布

小沫_jie

最新推荐文章于 2024-08-01 23:45:28 发布

阅读量3.3k

点赞数 1

分类专栏：面试爬虫实战

爬虫实战同时被 2 个专栏收录

5 篇文章 0 订阅

订阅专栏

面试

1 篇文章 0 订阅

订阅专栏

转自：https://www.cnblogs.com/wangshuyi/p/6734523.html

广度优先算法介绍

　　整个的广度优先爬虫过程就是从一系列的种子节点开始，把这些网页中的”子节点”(也就是超链接)提取出来，放入队列中依次进行抓取。被处理过的链接需要放入一张表(通常称为Visited表)中。每次新处理一个链接之前，需要查看这个链接是否已经存在于Visited表中。如果存在，证明链接已经处理过，跳过，不做处理，否则进行下一步处理。
　　初始的URL地址是爬虫系统中提供的种子URL(一般在系统的配置文件中指定)。当解析这些种子URL所表示的网页时，会产生新的URL(比如从页面中的http://www.admin.com “中提取出http://www.admin.com 这个链接)。然后，进行以下工作：
1. 把解析出的链接和Visited表中的链接进行比较，若Visited表中不存在此链接，表示其未被访问过。
2. 把链接放入TODO表中。
3. 处理完毕后，再次从TODO表中取得一条链接，直接放入Visited表中。
4. 针对这个链接所表示的网页，继续上述过程。如此循环往复。
广度优先遍历是爬虫中使用最广泛的一种爬虫策略，之所以使用广度优先搜索策略，主要原因有三点：
1. 重要的网页往往离种子比较近，例如我们打开新闻网站的时候往往是最热门的新闻，随着不断的深入冲浪，所看到的网页的重要性越来越低。
2. 万维网的实际深度最多能达到17层，但到达某个网页总存在一条很短的路径。而广度优先遍历会以最快的速度到达这个网页。
3. 广度优先有利于多爬虫的合作抓取，多爬虫合作通常先抓取站内链接，抓取的封闭性很强。

爬虫深度优先搜索

深度优先搜索是一种在开发爬虫早期使用较多的方法。它的目的是要达到被搜索结构的叶结点(即那些不包含任何超链的HTML文件) 。在一个HTML文件中，当一个超链被选择后，被链接的HTML文件将执行深度优先搜索，即在搜索其余的超链结果之前必须先完整地搜索单独的一条链。深度优先搜索沿着HTML文件上的超链走到不能再深入为止，然后返回到某一个HTML文件，再继续选择该HTML文件中的其他超链。当不再有其他超链可选择时，说明搜索已经结束。优点是能遍历一个Web 站点或深层嵌套的文档集合；缺点是因为Web结构相当深,，有可能造成一旦进去，再也出不来的情况发生。