pythonspark任务_Python+Spark2.0+hadoop学习笔记——pyspark基础

最新推荐文章于 2024-05-17 09:27:34 发布

weixin_39655993

最新推荐文章于 2024-05-17 09:27:34 发布

阅读量138

点赞数

文章标签： pythonspark任务

在历经千辛万苦后，终于把所有的东西都配置好了。

下面开始介绍pyspark的一些基础内容，以字数统计为例。

1)在本地运行pyspark程序

读取本地文件

textFile=sc.textFile("file:/usr/local/spark/README.md")

textFile.count()

读取HDFS文件

textFile=sc.textFile('hdfs://master:9000/user/*********/wordcount/input/LICENSE.txt")

textFile.count()

2)在Hadoop YARN运行pyspark

HADOOP_CONF_DIR=/usr/local/hadoop/etc/hadoop pyspark --master yarn --deploy-more client

textFile=sc.textFile('hdfs://master:9000/user/*********/wordcount/input/LICENSE.txt")

textFile.count()

3)构建Spark Standalone Cluster运行环境

cp /usr/local/spark/conf/spark-env.sh.template /usr/local/spark/conf/spark-env.sh

sudo gedit /usr/local/spark/conf/spark

然后进行下面的设置

export SPARK_MASTER_IP=master

export SPARK_WORKER_CORES=1

export SPARK_WORKER_MEMORY=512m

export SPARK_WORKER_INSTANCES=4

然后连接每个计算机，之后启动Spark Standalone Cluster

/usr/local/spark/sbin/start-all.sh

pyspark --master spark://master:7077 --num-executors 1 --total-executor-cores 3 --executor 512m

读取本地文件

textFile=sc.textFile("file:/usr/local/spark/README.md")

textFile.count()

读取HDFS文件

textFile=sc.textFile('hdfs://master:9000/user/*********/wordcount/input/LICENSE.txt")

textFile.count()

weixin_39655993

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
pythonspark任务_Python+Spark2.0+hadoop学习笔记——pyspark基础

在历经千辛万苦后，终于把所有的东西都配置好了。下面开始介绍pyspark的一些基础内容，以字数统计为例。1)在本地运行pyspark程序读取本地文件textFile=sc.textFile("file:/usr/local/spark/README.md")textFile.count()读取HDFS文件textFile=sc.textFile('hdfs://master:9000/user/*...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。