目录
1 定义
2 分类
3 基本流程
4总结
1 定义
爬虫,又称为网络蜘蛛、网络机器人等,简单来说,就是请求网站并提取数据的自动化程序,可以代替人工在互联网上收集数据。
2 分类
通用网络爬虫
搜索引擎离不开爬虫,比如百度搜索引擎的爬虫叫百度蜘蛛(Baiduspider)、Bing的Bingbot、360的360Spider、搜狗的SougouSpider。搜索引擎的爬虫每天在海量的网页中爬取优质的信息并进行收录,根据用户输入的关键字在收录的信息中找到相关网页,并按照一定的算法进行排序显示给用户。这种在全互联网上获取信息的爬虫称为 通用网络爬虫或全网爬虫。
聚焦网络爬虫
聚焦网络爬虫,也叫主题网络爬虫,是根据我们的需求有选择性的爬取相关内容,在《十分钟生成自己的疫情地图,小白都能立刻上手》文章中,小媛儿获取疫情统计数据所用的爬虫,就是这种类型。
3 基本流程
基本流程主要包括四步:
发起请求
获取内容
解析内容
保存数据
爬虫的基本流程前两步是在模仿浏览器对服务器进行Resquest,获取从服务器的Response信息。
我们先来看一下浏览器对服务器的http请求过程
我们看到的网页是浏览器多次对服务器发送请求解析的结果,整个交互过程可以在浏览器中 通过右击-检查(或审查元素)-Network查看。
比如我们在浏览器中输入www.bing.com,查看的结果如图。