scrapy研究探索（二）——爬w3school.com.cn

最新推荐文章于 2024-03-22 16:59:33 发布

原创

最新推荐文章于 2024-03-22 16:59:33 发布 · 4.9w 阅读

44 ·

CC 4.0 BY-SA版权

文章标签：

#Scrapy #python #python爬虫 #firefox插件

本文详细介绍了使用Scrapy爬取w3school.com.cn上的XML基础教程，包括项目创建、items定义、pipelines处理、爬虫编写及数据提取。通过Firefox插件辅助定位XPath，解析网页数据并保存到JSON文件。此外，还讲解了如何利用log功能记录信息。

下午被一个问题困扰了好一阵，最终使用另一种方式解决。

开始教程二，关于Scrapy安装、介绍等请移步至教程（一）（http://blog.csdn.net/u012150179/article/details/32343635）。

在开始之前假设你已经成功安装一切所需，整怀着一腔热血想要抓取某网站。一起来have a try。

1．前期基础准备。

Oh,不能在准备了，直接来。

（1）创建项目。

输入：

scapy startproject w3school

以上创建项目w3school。这时会产生w3school文件夹，文件夹下文件如下：

scrapy.cfg
w3school/
    __init__.py
    items.py
    pipelines.py
    settings.py
    spiders/
        __init__.py

其中scrapy.cfg目的配置文件。主要改写的是w3school中的三个文件以及其中spiders中需要编写的爬虫。

一个一个来。

（2）在items.py中定义Item容器。也就是编写items.py内容。

所谓Item容器就是将在网页中获取的数据结构化保存的数据结构，类似于python中字典。下面为items.py中代码。

#project: w3school
#file   : items.py
#author : younghz
#brief  : define W3schoolItem.

from scrapy.item import Item,Field

class W3schoolItem(Item):
    title = Field()
    link = Field()
    desc = Field()

上面定义了自己的W3schoolItem类，它继承自scrapy的Item（这里没有显示定义W3schoolItem的__init__()方法，也正因为如此，python也会为你自动调用基类的__init__()，否则必须显式在子类的__init__()中调用基类__init__()）。

之后声明W3schoolItem中元素并使用Field定义。到此items.py就OK了。

（3）在pipelines.py中编写W3schoolPipeline实现对item的处理。

在其中主要完成数据的查重、丢弃，验证item中数据，将得到的item数据保存等工作。代码如下：

最低0.47元/天解锁文章

10 条评论

Security00 2017.08.08
你好，谢谢你的分享，但是为什么json文件为空呢，谢谢啦~

byagl136 2017.01.19
可以爬，代码有几个地方要修改下。具体看log信息

NigelWu95 2016.11.09
好像已经爬不下来了是吗？

空腹熊猫 2015.12.17
好像要用logging模块，然后msg函数改用log，info参数要是整数

lilyef2000 2015.08.26
[quote=lilyef2000]博主，我的环境是WinXPsp3，python 2.7.10 scrapy的log模块不被支持，需要...[/quote] #log.msg("Append done.",level='INFO') #使用python的logging时，使用下列代码 logging.info("Append done.")

lilyef2000 2015.08.26
博主，我的环境是WinXPsp3，python 2.7.10 scrapy的log模块不被支持，需要换成python的logging模块，文件w3school_spider.py要做一点小小的修改

huafusuoliyin 2015.05.11
你好，感谢你把scrapy 讲解的那么清晰。其中有一个瑕疵，就是你生成的JSON 不是严格意义上的JSON，正确的格式是 { "title": {"XML 教程"}, "link": {"/xml/"}, ... } 每个内容后面跟的应该是{ }这个类型的括号而不是 [ ]中括号。再次感谢你的blog.