爬虫数据存入MongoDB

最新推荐文章于 2023-05-13 19:33:12 发布

原创最新推荐文章于 2023-05-13 19:33:12 发布 · 1.8k 阅读

5 ·

CC 4.0 BY-SA版权

爬虫专栏收录该内容

2 篇文章

订阅专栏

本文介绍了如何使用Scrapy与pymongo将爬取的数据存入MongoDB数据库。首先启动MongoDB服务，然后在Scrapy项目的settings.py中配置数据库连接，接着在Pipelines.py中编写代码。值得注意的是，MongoDB在插入数据时会自动创建集合（相当于MySQL的数据表）。

Scrapy+pymongo

首先开启本地的MongoDB服务

sudo service mongodb start

在settings.py文件中添加数据库的配置项

MONGO_HOST = "127.0.0.1"  # 主机IP
MONGO_PORT = 27017  # 端口号
MONGO_DB = "Spider"  # 库名 
MONGO_COLL = "heartsong"  # collection名
# MONGO_USER = "zhangsan"
# MONGO_PSW = "123456"

然后编写Pipelines.py

# -*- coding: utf-8 -*-

import pymongo
from scrapy.conf import settings

class HeartsongPipeline(object):
    def __init__(self):
        # 链接数据库
        self.client = pymongo.MongoClient(host=settings['MONGO_HOST'], port=settings['MONGO_PORT'])
        # 数据库登录需要帐号密码的话
        # self.client.admin.authenticate(settings['MINGO_USER'], settings['MONGO_PSW'])
        self.db = self.client[settings['MONGO_DB']]  # 获得数据库的句柄
        self.coll = self.db[settings['MONGO_COLL']]  # 获得collection的句柄

    def process_item(self, item, spider):
        postItem = dict(item)  # 把item转化成字典形式
        self.coll.insert(postItem)  # 向数据库插入一条记录
        return item  # 会在控制台输出原item数据，可以选择不写