一、爬虫概念
1.什么是爬虫?
程序猿:写程序,然后去互联网上抓取数据的过程
互联网:网,有好多的a链接组成的,网的节点就是每一个a链接 url(统一资源定位符)
2.哪些语言可以实现爬虫?
(1)php,可以做,号称世界上最优美的语言,多进程、多线程支持的不好
(2)java,也可以做爬虫,人家做的很好,最主要的竞争对手,代码臃肿,重构成本大
(3)c、c++,是你能力的体现,不是良好的选择
(4)python,语法简单、代码优美,学习成本低,支持的模块多,非常强大的框架 scrapy
二、爬虫分类:通用爬虫、聚焦爬虫
1.通用爬虫:
例如:百度、360、搜狐、谷歌、必应等
原理:
(1)抓取网页
(2&#