scrapy框架将数据写入txt出现数据丢失

最新推荐文章于 2021-07-15 17:22:48 发布

烤奶要加冰

最新推荐文章于 2021-07-15 17:22:48 发布

阅读量1.1k

点赞数

分类专栏：爬虫文章标签： scrapy 异步写入数据

本文链接：https://blog.csdn.net/qq_42349944/article/details/102680166

版权

爬虫专栏收录该内容

2 篇文章 0 订阅

订阅专栏

分析:

获取网页中的数据可以成功爬取，但是在写入txt操作的时候部分数据丢失。可能原因是scrapy框架是异步爬取数据，所以写入数据的时候不能完全写入完整的数据。

解决方法：

一、代码

pipelines.py

# 开启爬虫前调用
def open_spider(self, spider):
    self.file = open(r'novels/dhzmg.txt', 'w', encoding='utf-8')

# parse()返回值时调用，一般在这里写入数据
def process_item(self, item, spider):
    try:
        res = dict(item)
        title = res['title']
        line = res['data']
        self.file.write(title+'\n'+line+'\n\n')
   except:
        pass

# 关闭爬虫后调用，此处用于关闭文件连接
def close_spider(self, spider):
    self.file.close()

说明：
- open_spider()：开启爬虫前调用，可用于创建连接对象；
- close_spider()：关闭爬虫后调用，可以用于关闭文件连接；
- process_item()：此函数用于写入数据操作，在parse()返回值的时候自动调用。

二、配置

使用pipeline.py文件中的方法时，需要在setting.py更改设置。

setting.py

ITEM_PIPELINES = {
   'myscrapy.pipelines.MyscrapyPipeline': 300,
}

找到这个配置，取消前面的注释即可。

烤奶要加冰

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
scrapy框架将数据写入txt出现数据丢失

分析:获取网页中的数据可以成功爬取，但是在写入txt操作的时候部分数据丢失。可能原因是scrapy框架是异步爬取数据，所以写入数据的时候不能完全写入完整的数据。解决方法：一、代码pipelines.py# 开启爬虫前调用def open_spider(self, spider): self.file = open(r'novels/dhzmg.txt', 'w', enco...
复制链接

扫一扫