Python Scrapy持久化存储

最新推荐文章于 2024-05-09 10:39:33 发布

Python 学习者

最新推荐文章于 2024-05-09 10:39:33 发布

阅读量798

点赞数 3

分类专栏： python

原文链接：https://www.jianshu.com/u/8f2987e2f9fb

版权

python 专栏收录该内容

1472 篇文章 279 订阅

订阅专栏

基于终端指令的持久化存储

　　保证爬虫文件的parse方法中有可迭代类型对象（通常为列表or字典）的返回，该返回值可以通过终端指令的形式写入指定格式的文件中进行持久化操作;

执行输出指定格式进行存储：将爬取到的数据写入不同格式的文件中进行存储

基于管道的持久化存储

　　scrapy框架中已经为我们专门集成好了高效、便捷的持久化操作功能，我们直接使用即可：

　　　 items.py : 数据结构模板文件，定义数据属性；

　　　　pipelines.py ：管道文件，接受item类型的数据，进行持久化操作；

持久化流程：

在爬虫文件中获取到数据后，将数据封装到 items对象中；

通过 yield 关键字将items对象提交给pipelines管道进行持久化操作；

在管道文件中的process_item方法中接收爬虫文件提交过来的item对象，然后编写持久化存储的代码将item对象存储的数据进行持久化存储；

settings.py文件中开启管道：

终端持久化存储示例：

将糗事百科首页中的段子和作者数据爬取下来，然后进行持久化存储

爬虫程序

settings

执行:

scrapy crawl qiubai -o qiubai.csv

执行完之后的结果:

管道持久化存储示例:

爬取Boss直聘网中Python爬虫岗位的职位名称,薪资,公司名称

爬虫程序

items

pipelines

settings

执行:

scrapy crawl boss --nolog

基于MySQL的持久化存储

pipelines

settings

执行爬虫程序,并去数据库中查看数据

基于redis管道存储

pipelines

settings

执行代码并且查看redis中的数据

redis已经存在数据了,因为编码问题所以不显示中文.

Python 学习者

关注

3
点赞
踩
3

收藏

觉得还不错? 一键收藏
0
评论
Python Scrapy持久化存储

基于终端指令的持久化存储　　保证爬虫文件的parse方法中有可迭代类型对象（通常为列表or字典）的返回，该返回值可以通过终端指令的形式写入指定格式的文件中进行持久化操作;执行输出指定格式进行存储：将爬取到的数据写入不同格式的文件中进行存储基于管道的持久化存储　　scrapy框架中已经为我们专门集成好了高效、便捷的持久化操作功能，我们直接使用即可：　　　 items.p...
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。