网络爬虫(又被称为网页蜘蛛,网络机器人)就是模拟客户端发送网络请求,获取请求响应数据,一种按照一定的规则,自动地抓取互联网信息的程序。
只要是浏览器能做的事情,原则上,爬虫都能够做
主要用途
数据采集
爬虫的更多用途(了解)
12306抢票/各种抢购
网站上的投票
短信轰炸
网络攻击
Web漏洞扫描器
爬虫的分类
按照爬取范围分为两类
通用爬虫
又称全网爬虫(Scalable Web Crawler),它将爬取对象从一些种子 URL扩充到整个Web上的网站,主要用途是为门户站点搜索引擎和大型Web服务提供商采集数据。
这类网络爬虫的 爬行范围和数量巨大,对于 爬行速度和存储空间要求较高,对于爬行页面的顺序要求相对较低,同时由于待刷新的页面太多,通常采用并行工作方式,但需要较长时间才能刷新一次页面。
聚焦爬虫
聚焦爬虫(Focused Crawler),又称主题网络爬虫(Topical Crawler),是指选择性地爬行那些与预先定义好的主题相关的页面的网络爬虫。
和通用爬虫相比,聚焦爬虫只需要爬行与主题相关的页面,从而极大地节省了硬件和网络资源,保存的页面也由于数量少而更新快,还可以很好地满足一些特定人群对特定领域信息的需求。
通用爬虫的局限性(了解)
通用搜索引擎所返回的网页里90%的内容无用。
不同用户搜索的目的不全相同,但是返回内容相同
图片、音频、视频多媒体的内容通用搜索引擎无能为力