1.爬虫是什么
所谓爬虫,就是按照一定的规则,自动的从网络中抓取信息的程序或者脚本网络,又被称为网页蜘蛛,网络机器人。万维网就像一个巨大的蜘蛛网,我们的爬虫就是上面的一个蜘蛛,不断的去抓取我们需要的信息。
2.爬虫三要素抓取
分析
存储
3.爬虫的过程分析
当人类去访问一个网页时,是如何进行的?
①打开浏览器,输入要访问的网址,发起请求。
②等待服务器返回数据,通过浏览器加载网页。
③从网页中找到自己需要的数据(文本、图片、文件等等)。
④保存自己需要的数据。
对于爬虫,也是类似的。它模仿人类请求网页的过程,但是又稍有不同。
首先,对应于上面的①和②步骤,我们要利用python实现请求一个网页的功能。
其次,对应于上面的③步骤,我们要利用python实现解析请求到的网页的功能。
最后,对于上面的④步骤,我们要利用python实现保存数据的功能。
因为是讲一个简单的爬虫嘛,所以一些其他的复杂操作这里就不说了。下面,针对上面几个功能,逐一进行分析。
4.如何用python请求一个网页
作为一门拥有丰富类库的编程语言,利用python请求网页完全不在话下。
4.1.抓取网页urllib.request库使用
import urllib.request response = urllib.request.urlopen('https://laoniu.blog.csdn.net/')print(response.read().decode('utf-8'))
这样就可以抓取csdn我的主页的html文档
我们使用爬虫就是需要在网页中提取我们需要的数据,接下来我们来学习抓取一下百度搜索页的热榜数据
4.2.如何解析网页呢
使用lxml库
lxml 是一种使用 Python 编写的库&#