Scrapy入门程序点评

最新推荐文章于 2016-10-28 10:10:30 发布

fullerhua

最新推荐文章于 2016-10-28 10:10:30 发布

阅读量962

点赞数

分类专栏：一起学习python网络爬虫文章标签： python 网络爬虫编程 scrapy

本文链接：https://blog.csdn.net/fullerhua/article/details/51658958

版权

一起学习python网络爬虫专栏收录该内容

27 篇文章 0 订阅

订阅专栏

1，引言

在《 Scrapy的架构初探》一文，我基于爬虫开发的经验对Scrapy官网文章作了点评和解读，事件驱动的异步处理架构、极强的模块化等是个绝好的框架，接着我细读了官网的《 Scrapy at a glance 》，更加强了我的感受：就是他了—— 开源Python即时网络爬虫项目需要一个爬虫框架，我不想重复发明轮子，只想专注于爬虫里面的提取器的生成和使用，也就是Scrapy中的Spider部分。

本文大部分内容摘抄自Scrapy官网的《 Scrapy at a glance 》，看到Scrapy巧妙之处则加了点评。

2，Scrapy的Spider例子

在Scrapy的框架中，Spider与GooSeeker开源爬虫的提取器类似，核心特征是

Spider通常针对一个特定网站
Spider里面存了爬行入口URLs集合
Scrapy的引擎顺序拿Spider中的入口URL，构造Request对象，启动消息循环
Spider提供接口方法，把抓取下来的内容进行输出

对GooSeeker的MS谋数台和DS打数机比较了解的读者，可以把Spider想象成：MS谋数台上定义的一组抓取规则 + 会员中心的爬虫罗盘

下面我们从官网拷贝一个例子：

class StackOverflowSpider(scrapy.Spider):
    name = 'stackoverflow'
    start_urls = ['http://stackoverflow.com/questions?sort=votes']

    def parse(self, response):
        for href in response.css('.question-summary h3 a::attr(href)'):
            full_url = response.urljoin(href.extract())
            yield scrapy.Request(full_url, callback=self.parse_question)

    def parse_question(self, response):
        yield {
            'title': response.css('h1 a::text').extract()[0],
            'votes': response.css('.question .vote-count-post::text').extract()[0],
            'body': response.css('.question .post-text').extract()[0],
            'tags': response.css('.question .post-tag::text').extract(),
            'link': response.url,
        }

看这个例子需要注意以下几点