Spark
spark
H_w
这个作者很懒,什么都没留下…
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
Spark2.2 (八) SparkSql读写MySQL
Spark读写MySQL1.配置信息2.需求示例3.完整代码实现4.输出结果5.总结 1.配置信息 下面展示一些 内联代码片。 #mysql数据库配置 mysql.driver=com.mysql.jdbc.Driver mysql.url=jdbc:mysql://localhost:3306/test?serverTimezone=UTC mysql.user=****** mysql.password=****** 2.需求示例 1.mysql中score表示例数据 mysql> select原创 2020-10-16 18:21:58 · 634 阅读 · 0 评论 -
Spark2.2 (七) Spark Streaming与外部存储介质
一、将DStream输出到文件中 Spark Streaming提供了多个上层接口,用于将DStream书出到外部文件,包括saveAsObjectFiles、saveAsTextFiles、saveAsHadoopFiles,可以分别将DStram输出到序列化文件,文本文件及Hadoop文件中。 下面简单的词频统计将DStream输出到文本文件中 关键步骤 1、构建一个流式上线文,配置我们Spa...原创 2019-10-17 14:35:56 · 575 阅读 · 0 评论 -
Spark2.2 (六) Spark Streaming分析Kakfa数据
Spark Streaming分析Kakfa数据 环境 spark-2.2.0 kafka-2.11-2.30 zookeeper-3.5.5 kafka Producer开发 package doc import java.util.Properties import org.apache.kafka.clients.producer.{KafkaProducer, ProducerReco...原创 2019-10-16 17:42:58 · 334 阅读 · 0 评论 -
Spark2.2(一)RDD
Spark2.2文档(一)RDD package doc.rdd import org.apache.spark.{SparkConf, SparkContext} /** * @Program: doc.rdd * @Author: huangwei * @Date: 2019/9/5 18:03 * @description: Spark最重要的一个抽象概念就是弹性分布式数...原创 2019-09-18 18:04:23 · 248 阅读 · 0 评论 -
Spark2.2(二)RDD算子
Spark2.2文档(二)RDD算子 package doc.rdd import org.apache.spark.util.DoubleAccumulator import org.apache.spark.{SparkConf, SparkContext} /** * @Program: doc.rdd * @Author: huangwei * @Date: 2019/9/...原创 2019-09-18 18:16:26 · 211 阅读 · 0 评论 -
Spark2.2(三)SparkSql数据源
SparkSql数据源 package doc.df import java.util.Properties import org.apache.hadoop.fs.{FileSystem, Path} import org.apache.hadoop.mapred.{FileOutputFormat, JobConf} import org.apache.hadoop.mapred.lib....原创 2019-09-18 18:18:09 · 424 阅读 · 0 评论 -
Spark2.2(四)用户自定义聚合函数
用户自定义聚合函数 package doc.df import org.apache.spark.sql.{Row, SparkSession} import org.apache.spark.sql.expressions.{MutableAggregationBuffer, UserDefinedAggregateFunction} import org.apache.spark.sql.t...原创 2019-09-18 18:21:18 · 522 阅读 · 0 评论 -
Spark2.2(五)SparkSQL读写Hive
IDEA中使用SparkSQL读写Hive 添加依赖 libraryDependencies ++= Seq("org.apache.spark" %% "spark-core" % "2.2.0", "org.apache.spark" %% "spark-sql" % "2.2.0", ...原创 2019-09-20 17:54:04 · 1592 阅读 · 0 评论
分享