- 博客(2)
- 收藏
- 关注
原创 Scrapy - 普通的Spider(二)
XMLFeedSpider 这个Spider是用于解析XML的,它可以通过指定的节点迭代的解析XML。迭代器可以选择iternodes,xml或html。由于xml和html都需要一次性读取整个DOM然后才能解析XML,这样会有性能的问题,所以推荐使用iternodes迭代器。但是当解析有错误标记的XML时,使用html迭代器会有些帮助。 使用XMLFeedSpider必须定义以下类属性来设置迭代器
2017-11-02 22:21:11 363
原创 Scrapy - 普通的Spider(一)
CrawlSpider 这个是Spider中爬取一般网站最常用的一种Spider,因为它提供了一种方便的机制可以自定义一套规则去追踪链接。它可能对特殊的网站或项目来说不是最适合的Spider,但是对一般情况来说已经足够了,因此我们可从这种Spider开始学习,然后修改它,或重新写一个自定义的Spider。除了从父类集成来的属性,这个Spider还有特有的属性和方法: rules - 一个Rul
2017-11-02 21:24:18 447
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人