pythonspark任务_Python+Spark2.0+hadoop学习笔记——pyspark基础

在历经千辛万苦后,终于把所有的东西都配置好了。

下面开始介绍pyspark的一些基础内容,以字数统计为例。

1)在本地运行pyspark程序

读取本地文件

textFile=sc.textFile("file:/usr/local/spark/README.md")

textFile.count()

读取HDFS文件

textFile=sc.textFile('hdfs://master:9000/user/*********/wordcount/input/LICENSE.txt")

textFile.count()

2)在Hadoop YARN运行pyspark

HADOOP_CONF_DIR=/usr/local/hadoop/etc/hadoop pyspark --master yarn --deploy-more client

textFile=sc.textFile('hdfs://master:9000/user/*********/wordcount/input/LICENSE.txt")

textFile.count()

3)构建Spark Standalone Cluster运行环境

cp /usr/local/spark/conf/spark-env.sh.template /usr/local/spark/conf/spark-env.sh

sudo gedit /usr/local/spark/conf/spark

然后进行下面的设置

export SPARK_MASTER_IP=master

export SPARK_WORKER_CORES=1

export SPARK_WORKER_MEMORY=512m

export SPARK_WORKER_INSTANCES=4

然后连接每个计算机,之后启动Spark Standalone Cluster

/usr/local/spark/sbin/start-all.sh

pyspark --master spark://master:7077 --num-executors 1 --total-executor-cores 3 --executor 512m

读取本地文件

textFile=sc.textFile("file:/usr/local/spark/README.md")

textFile.count()

读取HDFS文件

textFile=sc.textFile('hdfs://master:9000/user/*********/wordcount/input/LICENSE.txt")

textFile.count()

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值