Scrapy
文章平均质量分 80
rossisy
这个作者很懒,什么都没留下…
展开
-
Scrapy - 简要指南
创建项目开始爬取数据之前,你必须先创建一个Scrapy项目。进入你想将项目代码保存的目录,并执行以下代码MacBook-Pro:scrapy $ scrapy startproject projectname这会创建一个以projectname命名的文件夹,文件夹中包括一个部署配置文件scrapy.cfg和一个项目的python模块(以projectname命名的另一个文件原创 2017-10-15 16:03:27 · 1046 阅读 · 0 评论 -
Scrapy - 命令行工具
Scrapy是由scrapy命令行工具来控制的,它的命令行工具为多种用途提供了一些不同的命令,每一个命令都有不同的参数和选项。一些Scrapy命令必须在Scrapy项目目录下执行,另一些可以在任何目录下执行。而那些可以在任何目录下执行的命令,如果在Scrapy项目目录下执行可能会有些不同。Scrapy命令执行环境Global commandsProject-only原创 2017-10-25 19:44:31 · 1833 阅读 · 0 评论 -
Scrapy - 普通的Spider(一)
CrawlSpider这个是Spider中爬取一般网站最常用的一种Spider,因为它提供了一种方便的机制可以自定义一套规则去追踪链接。它可能对特殊的网站或项目来说不是最适合的Spider,但是对一般情况来说已经足够了,因此我们可从这种Spider开始学习,然后修改它,或重新写一个自定义的Spider。除了从父类集成来的属性,这个Spider还有特有的属性和方法:rules - 一个Rul原创 2017-11-02 21:24:18 · 463 阅读 · 0 评论 -
Scrapy - 普通的Spider(二)
XMLFeedSpider这个Spider是用于解析XML的,它可以通过指定的节点迭代的解析XML。迭代器可以选择iternodes,xml或html。由于xml和html都需要一次性读取整个DOM然后才能解析XML,这样会有性能的问题,所以推荐使用iternodes迭代器。但是当解析有错误标记的XML时,使用html迭代器会有些帮助。使用XMLFeedSpider必须定义以下类属性来设置迭代器原创 2017-11-02 22:21:11 · 374 阅读 · 0 评论