spark SQL实例(load和save操作)

该博客主要介绍了Spark SQL中的load和save操作。load用于加载数据形成DataFrame,save则用于将DataFrame数据保存到文件。通过示例展示了默认使用parquet数据源以及手动指定数据源类型的操作,并提及了SaveMode的四种模式:ErrorIfExists(默认,数据已存在时抛出异常)、Append(追加数据)、Overwrite(覆盖数据)和Ignore(数据已存在则忽略)。
摘要由CSDN通过智能技术生成

load操作:主要用于加载数据,创建出DataFrame

save操作:主要用于将DataFrame中的数据保存到文件中

代码示例(默认为parquet数据源类型)

package wujiadong_sparkSQL

import org.apache.spark.sql.SQLContext
import org.apache.spark.{SparkConf, SparkContext}

/**
  * Created by Administrator on 2017/2/3.
  */
object GenericLoadSave {
   
  def main(args: Array[String]): Unit = {
    val conf = new SparkConf().setAppName("GenericLoadSave")
    val sc = new SparkContext(conf)
    val sqlContext = new SQLContext(sc)
//load默认是加载parquet格式文件
    val usersDF = sqlContext.read.load("hdfs://master:9000/student/2016113012/spark/users.parquet")
    usersDF.write.save("hdfs://master:9000/student/2016113012/parquet_out1")

  }

}

提交集群运行

hadoop@master:~/wujiadong$ spark-submit –class wujiadong_sparkSQL.GenericLoadSave –executor-memory 500m –total-executor-cores 2 /h

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值