spark
Andy勇敢一次
Java/分布式架构/高可用服务/金融风控
Hadoop/大数据架构/数仓建模/数据引擎
Python/数据分析/深度学习/大模型技术
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
import spark.implicits._ 报红,无法导入
先给出错误的代码 def main(args: Array[String]): Unit = { //Create SparkConf() And Set AppName SparkSession.builder() .appName("Spark Sql basic example") .config("...原创 2020-02-02 15:52:15 · 923 阅读 · 0 评论 -
Spark SQL/DataFrame/DataSet操作(一)-----读数据
一、读取数据源 (1)读取json ,使用spark.read。注意:路径默认是从HDFS,如果要读取本机文件,需要加前缀file://,如下 scala> val people = spark.read.format("json").load("file:///opt/software/data/people.json") people: org.apache.spark.sql.Data...原创 2020-02-02 15:34:45 · 640 阅读 · 0 评论 -
Spark的RDD操作之Join大全
一、RDD的Join操作有哪些? (一)Join:Join类似于SQL的inner join操作,返回结果是前面和后面集合中配对成功的,过滤掉关联不上的。源代码如下: /** Return an RDD containing all pairs of elements with matching keys in this and other. Each pair of elements w...原创 2020-01-17 14:06:53 · 1727 阅读 · 0 评论 -
Spark failed to delete temp directory
一,错误日志 17/05/02 11:56:57 INFO ShutdownHookManager: Deleting directory C:\Users\arpitbh\AppData\Local\Temp\spark-03f14dbe-1802-40ca-906c-af8de0f462f9 17/05/02 11:56:57 ERROR ShutdownHookManager: Except...原创 2020-01-17 14:05:52 · 2557 阅读 · 0 评论 -
Apache Spark实战教程(三):两个RDD求交集 差集 并集
一.前言 spark中两个rdd,经常需要做交集,差集,并集等操作。好比任何一门编程语言中两个集合,交并差也是常见的需求。现在我们看看在spark中怎么实现两个rdd的这种操作。 为了方便看到结果,在spark shell中测试如下代码。 生成两个RDD scala> val rdd1 = sc.parallelize(List("a", "b","c")) rdd1: org.apache...原创 2020-01-17 14:05:01 · 1863 阅读 · 0 评论 -
Apache Spark实战教程(二):Spark 中需要两个RDD进行嵌套操作
一,前言 因为在Spark中进行RDD的嵌套操作,所以在操作的时候报了一个错误 Caused by: org.apache.spark.SparkException: This RDD lacks a SparkContext. It could happen in the following cases: RDD transformations and actions are NOT invo...原创 2020-01-17 14:03:35 · 1887 阅读 · 1 评论 -
Apache Spark渐进式学习教程(三): Spark单节点安装和快速入门Demo
一,下载Spark 使用 Spark 的第一步是下载和解压缩。我们先从下载预编译版本的 Spark 开始。访问http://spark.apache.org/downloads.html,进行spark安装包的下载。本文使用版本为:spark-2.4.3-bin-hadoop2.7.tgz 二,安装Spark cd ~ tar -xf spark-2.4.3-bin-hadoop2.7...原创 2019-07-29 17:42:11 · 320 阅读 · 0 评论 -
Apache Spark渐进式学习教程(八):Spark集群部署(standalone)和运行
目录 一,前言 1.1 集群规划 1.2 前置条件 1.3 安装包下载 二,安装部署 2.1,解压和修改配置文件 2.2 复制文件到另外2台机器 三,运行和测试 3.1启动集群 3.2启动spark-shell连接集群 3.2提交spark任务到集群 一,前言 1.1 集群规划 需要已经配置免密登录的三台CentOS7服务器: IP地址 hosts 节点身...原创 2019-08-02 17:19:41 · 584 阅读 · 0 评论 -
Apache Spark渐进式学习教程(二):核心模块 Spark Core, Spark SQL, Spark Streaming, MLib 介绍
目录 前言:spark 软件栈图 一,Spark Core 二,Spark SQL 三,Spark Streaming 四,MLib 前言:spark 软件栈图 一,Spark Core Spark Core 实现了 Spark 的基本功能,包含任务调度、内存管理、错误恢复、与存储系统交互等模块。Spark Core 中还包含了对弹性分布式数据集(resilient distr...原创 2019-07-23 14:07:01 · 1084 阅读 · 0 评论 -
Apache Spark渐进式学习教程(一) :学习路线和教程
目录 一,官网 二,书籍 三,视频教程 一,官网 地址:http://spark.apache.org/ 二,书籍 《spark 快速大数据分析.pdf》 链接:https://pan.baidu.com/s/1Z4b0O-ChpOLky4ybZHGtyQ密码: 3wpc 三,视频教程 《Spark从零开始》https://www.imooc.com/learn/814 《...原创 2019-07-23 14:08:10 · 467 阅读 · 0 评论 -
Apache Spark渐进式学习教程(十):Spark Streaming简介和系统架构
目录 一,Spark Streaming简介 二,Spark Streaming 系统架构 三,动态负载均衡 四,容错性 五,实时性、扩展性与吞吐量 一,Spark Streaming简介 Spark Streaming 是 Spark 核心 API 的一个扩展,可以实现高吞吐量的、具备容错机制的实时流数据的处理。Spark Streaming 支持从多种数据源获取数据,包括 ...原创 2019-08-05 14:51:08 · 429 阅读 · 0 评论 -
Apache Spark渐进式学习教程(四): RDD编程
一,RDD 的基本概念 RDD 是 Spark 提供的最重要的抽象概念,它是一种有容错机制的特殊数据集合,可以分布在集群的结点上,以函数式操作集合的方式进行各种并行操作。 通俗点来讲,可以将 RDD 理解为一个分布式对象集合,本质上是一个只读的分区记录集合。每个 RDD 可以分成多个分区,每个分区就是一个数据集片段。一个 RDD 的不同分区可以保存到集群中的不同结点上,从而可以在集群中的不同结...原创 2019-08-01 11:33:36 · 402 阅读 · 0 评论 -
Apache Spark渐进式学习教程(五): 数据的读取与保存
目录 一,前言 1.1,文件格式与文件系统 1.2,Spark SQL中的结构化数据源 1.3,数据库与键值存储 二,文件格式 2.1,文本文件 2.2,JSON 2.3,逗号分隔值与制表符分隔值 三,文件系统 3.1 本地/“常规”文件系统 3.2 Amazon S3 3.3 HDFS 四,数据库 JdbcRDD操作 MySQL等关系型数据库 一,前言 Sp...原创 2019-08-01 15:07:08 · 432 阅读 · 0 评论 -
Apache Spark渐进式学习教程(十一):Spark Streaming快速入门和api介绍
目录 一,快速入门Demo 二,API介绍 DStream 的转换操作 窗口转换操作 输出操作 持久化 一,快速入门Demo 新建maven工程并添加scala支持。 引入如下pom文件: <dependency> <groupId>org.apache.spark</groupId> ...原创 2019-08-05 17:16:07 · 443 阅读 · 0 评论 -
Apache Spark渐进式学习教程(六): SparkSQL简介及入门
目录 一、简介 1、SparkSQL的由来 2、SparkSql特点 二、SparkSQL入门 1、创建DataFrame对象 2、由外部文件构造DataFrame对象 一、简介 Spark为结构化数据处理引入了一个称为Spark SQL的编程模块。它提供了一个称为DataFrame(数据框)的编程抽象,DF的底层仍然是RDD,并且可以充当分布式SQL查询引擎。 1、Sp...原创 2019-08-01 15:56:34 · 378 阅读 · 0 评论
分享