简介
最近在学习python,这几篇博文用于个人记录总结,不正之处还望大佬指出。(适合学习过python的同学)
用Python写爬虫入门篇(一)
用Python写爬虫入门篇(二)
用Python写爬虫入门篇(三)
先简单介绍下爬虫的原理
概念
网络爬虫(又被称为网页蜘蛛,网络机器人,在FOAF社区中间,更经常的称为网页追逐者),是一种按照一定的规则,自动地抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁、自动索引、模拟程序或者蠕虫。(百度百科)
以上概念来自百度百科,意思大概是爬虫是用来爬取网络上各种信息的程序(比例如图片或关键字),可以用以帮人们完成机械重复的劳动。
爬虫架构
Python 爬虫架构主要由五个部分组成,分别是调度器、URL管理器、网页下载器、网页解析器、应用程序(爬取的有价值数据)
调度器:相当于一台电脑的CPU,主要负责调度URL管理器、下载器、解析器之间的协调工作。
URL管理器:包括待爬取的URL地址和已爬取的URL地址,防止重复抓取URL和循环抓取URL。
网页下载器:通过传入一个URL地址来下载网页,将网页转换成一个字符串,网页下载器有urllib2(Python官方基础模块)包括需要登录、代理、和cookie,requests(第三方包)
网页解析器:将一个网页字符串进行解析,可以按照我们的要求来提取出我们有用的信息,也可以根据DOM树的解析方式来解析。网页解析器有正则表达式html.parser 和 beautifulsoup 以及 lxml 都是以 DOM 树的方式进行解析的。
应用程序:就是从网页中提取的有用数据组成的一个应用。(菜鸟教程)
知道一些结构再写代码对未来进步大有帮助。
所需知识点
python
urllib
XPath
Beautiful Soup
Scrapy(进阶)
参考资料
百度百科
XPath 教程|菜鸟教程
Python3 教程|菜鸟教程
Python 爬虫介绍|菜鸟教程
Beautiful Soup 4.4.0 文档
Selenium with Python
Python爬虫小白入门
下一篇:
[用Python写爬虫入门篇(二)]