PySpark的不同文件格式读取

该博客介绍了如何使用PySpark读取不同文件格式,包括通过`sc.parallelize`创建RDD,从HDFS读取文本,以及读取CSV、TXT和JSON文件,并展示了相关操作如计数、查看数据等。
摘要由CSDN通过智能技术生成

PySpark的不同文件格式读取,如:sc.parallelize、hdfs读取资料、csv、txt 、json

## 用pysaprk建立第一个RDD
from __future__ import print_function,division
from pyspark import SparkConf,SparkContext
from pysaprk.sql import SparkSession

## 启动spark
spark= SparkSession.builder.master(‘local’).appName(‘test’).getOrCreate()
sc = spark.sparkContext

## 建立第一个RDD --- sparkContext
wordsList = ['cat','elephant','rat','cat']
wordsRDD = sc.parallelize(wordsList,2)   #parallelize
print(type(wordsRDD))                    #查看类型
wordsRDD.count()                         #查看行数
wordsRDD.take(5)                         #前5个项目
wordsRDD.collect()                       #适用于小数据量

## 从hdfs中读取资料
textFromHDFS = spark.read.text('hdfs://tmp/NASA_access') #读取文件
print(type(textFromH

  • 1
    点赞
  • 8
    收藏
    觉得还不错? 一键收藏
  • 4
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 4
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值