(1)Scrapy库
Scrapy是适用于Python的一个快速、高层次的屏幕抓取和web抓取框架,用于抓取web站点并从页面中提取结构化的数据。Scrapy用途广泛,可以用于数据挖掘、监测和自动化测试。
Scrapy吸引人的地方在于它是一个框架,任何人都可以根据需求方便的修改。它也提供了多种类型爬虫的基类,如BaseSpider、sitemap爬虫等,最新版本又提供了web2.0爬虫的支持。
Scrapy是一个适用爬取网站数据、提取结构性数据的应用程序框架,它可以应用在广泛领域:Scrapy 常应用在包括数据挖掘,信息处理或存储历史数据等一系列的程序中。通常我们可以很简单的通过 Scrapy 框架实现一个爬虫,抓取指定网站的内容或图片。
尽管Scrapy原本是设计用来屏幕抓取(更精确的说,是网络抓取),但它也可以用来访问API来提取数据。
这个库的安装跟前面requests、Beautiful Soup库一样的方法安装
(2)爬虫框架
爬虫框架就是实现爬虫功能的一个软件结构和功能组件的集合,可以说一个框架是一个半成品,能够帮助用户实现专业网络爬虫
(2)Scrapy爬虫的常用命令
(4)第一个实例
这是一个生成爬虫框架的工程目录
接下来正式开始改善代码:
生成器的有点:
(1)更加灵活
(2)更加节省内存
(3)运行速度更加快
(5)Scrapy爬虫的使用步骤
这个框架的爬虫数据类型分成了3个类:
这个类的数据对应的方法: