pyspark操作MongoDB

本文介绍了如何使用pyspark 2.3.2版本连接MongoDB,强调了不要安装最新版本的pyspark,并提供了连接字符串的正确格式。在处理大量数据时,可能会对电脑性能造成影响。代码可在原文中查看。
摘要由CSDN通过智能技术生成

有几点需要注意的:

  1. 不要安装最新的pyspark版本,请安装`pip3 install pyspark==2.3.2`

  2. `spark-connector`与平常的MongoDB写法不同,格式是:`mongodb://127.0.0.1:database.collection`

  3. 如果计算数据量比较大,你的电脑可能会比较卡,^_^

Show me the code!

#!/usr/bin/env python  
# -*- coding: utf-8 -*-
"""
@author: zhangslob
@file: spark_count.py 
@time: 2019/01/03
@desc:
    不要安装最新的pyspark版本
    `pip3 install pyspark==2.3.2`
    更多pyspark操作MongoDB请看https://docs.mongodb.com/spark-connector/master/python-api/
"""

import os
from pyspark.sql import SparkSession

# set PYSPARK_PYTHON to python36
os.environ['PYSPARK_PYTHON'] = '/usr/bin/python36'

# load mongodb data
# 格式是&#x
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值