spark数据导入、处理实例

最新推荐文章于 2023-03-20 11:33:17 发布

置顶法相

最新推荐文章于 2023-03-20 11:33:17 发布

阅读量3.6k

点赞数 1

分类专栏： spark 文章标签： spark 数据导入处理实例 Hive

本文链接：https://blog.csdn.net/weixin_38569817/article/details/72717403

版权

spark 专栏收录该内容

10 篇文章 0 订阅

订阅专栏

当项目中遇到所要分析的数据量较大情况时，本地python直接处理或导入数据库等普通的处理方式显然并不合适，不仅效率低下，且容易引起数据库崩溃。用spark将本地数据上传hdfs，写入hive，会更加高效。

下面实现简单的spark下数据处理方式，,语言为scala，供大家参考。

import com.databricks.spark.csv

import org.apache.spark._

import org.apache.spark.sql.hive.HiveContext

import scala.xml._

import org.apache.hadoop.fs.FileSystem

import org.apache.hadoop.fs.Path

import org.apache.hadoop.conf.Configuration

class CDataProcess{

def dataProcess(){

//initialize spark

val conf = new SparkConf()

val sc = new SparkContext(conf)

val sqlContext = new HiveContext(sc)

//initialize fs

val fs = FileSystem.get(new Configuration)

//get config

val config = XML.loadFile("./config.xml")

val nodes = config \ "FILE"

nodes.foreach { n =>

val database = (n \ "HIVE").text

val tableName = (n \ "TABLE").text

sqlContext.sql(s"use $database")

//import to hive

if( (n \\ "IMPORT TO HIVE").text.toBoolean ){

val filepath = ( n \\ "FILEPATH").text

//update file to hdfs

fs.copyFromLocationFile(false,new Path(filePath),new Path("/user/spark"))

val hdfsPath = "user/spark" + filePath.split("/").last

try{

val df = sqlContext.read.format("com.databricks.spark.csv").option("header","true").option("inferSchema","true").load(hdfsPath)

df.show()

df.write.mode("overwrite").saveAsTable(tableName)

}

catch case e:Exception => e.printStackTrace()

finally fs.delete(new Path(hdfsPath),false)

}

}

}

以上代码为将本地文件上传hdfs，在写入hive，如有不当之处，欢迎指正。

法相

关注

1
点赞
踩
8

收藏

觉得还不错? 一键收藏
0
评论
spark数据导入、处理实例

当项目中遇到所要分析的数据量较大情况时，本地python直接处理或导入数据库等普通的处理方式显然并不合适，不仅效率低下，且容易引起数据库崩溃。用spark将本地数据上传hdfs，写入hive，会更加高效。
复制链接

扫一扫

专栏目录