spark
文章平均质量分 93
zdy0_2004
这个作者很懒,什么都没留下…
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
三万字,Spark学习笔记
https://mp.weixin.qq.com/s/uoeyA09NacA5mzpKpX3neASpark 基础Spark特性Spark使用简练优雅的Scala语言编写,基于Scala提供了交互式编程体验,同时提供多种方便易用的API。Spark遵循“一个软件栈满足不同应用场景”的设计理念,逐渐形成了一套完整的生态系统(包括 Spark提供内存计算框架、SQL即席查询(Spark SQL)、流式计算(Spark Streaming)、机器学习(MLlib)、图计算(Graph X)等),S..转载 2021-02-21 11:50:48 · 760 阅读 · 0 评论 -
Spark算子系列文章
http://lxw1234.com/archives/2015/07/363.htmSpark算子:RDD基本转换操作(1)–map、flagMap、distinctSpark算子:RDD创建操作Spark算子:RDD基本转换操作(2)–coalesce、repartitionSpark算子:RDD基本转换操作(3)–randomSplit、glomS转载 2017-01-10 12:07:16 · 447 阅读 · 0 评论 -
图解Spark API
http://www.cnblogs.com/fanzhidongyzby/p/6185293.html初识spark,需要对其API有熟悉的了解才能方便开发上层应用。本文用图形的方式直观表达相关API的工作特点,并提供了解新的API接口使用的方法。例子代码全部使用python实现。1. 数据源准备准备输入文件:$ cat /tmp/inapplebag bag转载 2016-12-16 00:11:17 · 1152 阅读 · 0 评论 -
Spark SQL 用户自定义函数UDF、用户自定义聚合函数UDAF 教程(Java踩坑教学版)
http://www.cnblogs.com/xing901022/p/6436161.html在Spark中,也支持Hive中的自定义函数。自定义函数大致可以分为三种:UDF(User-Defined-Function),即最基本的自定义函数,类似to_char,to_date等UDAF(User- Defined Aggregation Funcat转载 2017-02-24 00:00:02 · 2182 阅读 · 0 评论 -
Spark性能优化之道——解决Spark数据倾斜(Data Skew)的N种姿势
http://www.cnblogs.com/jasongj/p/6508150.html摘要本文结合实例详细阐明了Spark数据倾斜的几种场景以及对应的解决方案,包括避免数据源倾斜,调整并行度,使用自定义Partitioner,使用Map侧Join代替Reduce侧Join,给倾斜Key加上随机前缀等。为何要处理数据倾斜(Data Skew)什么是数据倾斜对S转载 2017-03-06 09:39:06 · 421 阅读 · 0 评论 -
Spark结构式流编程指南
http://www.cnblogs.com/cutd/p/6590354.html概览Structured Streaming 是一个可拓展,容错的,基于Spark SQL执行引擎的流处理引擎。使用小量的静态数据模拟流处理。伴随流数据的到来,Spark SQL引擎会逐渐连续处理数据并且更新结果到最终的Table中。你可以在Spark SQL上引擎上使用DataSet/Data转载 2017-03-20 18:01:21 · 1209 阅读 · 0 评论 -
Spark RDD 核心总结
http://www.cnblogs.com/arachis/p/SparkRDD.html摘要: 1.RDD的五大属性 1.1 partitions(分区) 1.2 partitioner(分区方法) 1.3 dependencies(依赖关系) 1.4 compute(获取分区迭代列表) 1.5 pre转载 2017-03-22 09:48:48 · 714 阅读 · 0 评论 -
Spark源码分析之分区器的作用
http://www.cnblogs.com/xing901022/p/6718642.html先说说数据倾斜数据倾斜是指Spark中的RDD在计算的时候,每个RDD内部的分区包含的数据不平均。比如一共有5个分区,其中一个占有了90%的数据,这就导致本来5个分区可以5个人一起并行干活,结果四个人不怎么干活,工作全都压到一个人身上了。遇到这种问题,网上有很多的解决办法:转载 2017-04-16 22:35:38 · 457 阅读 · 0 评论 -
Spark SQL数据加载和保存实战
http://www.cnblogs.com/whyhappy/p/6740928.html一:前置知识详解: Spark SQL重要是操作DataFrame,DataFrame本身提供了save和load的操作, Load:可以创建DataFrame, Save:把DataFrame中的数据保存到文件或者说与具体的格式来指明我们要读取的文件的类型以及与具体的格转载 2017-04-21 01:25:35 · 1341 阅读 · 1 评论 -
Spark SQL笔记——技术点汇总
http://www.cnblogs.com/netoxi/p/7223413.html目录· 概述· 原理 · 组成 · 执行流程 · 性能· API · 应用程序模板 · 通用读写方法 · RDD转为DataFrame · Parquet文件数据源 · JSON文件数据源 ·转载 2017-07-31 23:17:46 · 715 阅读 · 0 评论 -
Catalyst 优化逻辑执行计划规则
http://blog.csdn.net/pelick/article/details/22723699Optimizer本文分析Catalyst Optimize部分实现的对逻辑执行计划(LogicalPlan)的处理规则。Optimizer处理的是LogicalPlan对象。Optimizer的batches如下:[j转载 2017-07-31 23:35:54 · 773 阅读 · 0 评论 -
整理对Spark SQL的理解
http://blog.csdn.net/pelick/article/details/22723699Catalyst是与Spark解耦的一个独立库,是一个impl-free的执行计划的生成和优化框架。目前与Spark Core还是耦合的,对此user邮件组里有人对此提出疑问,见mail。 以下是Catalyst较早时候的架构图,展示的是代码结构和转载 2017-07-31 23:44:29 · 696 阅读 · 0 评论 -
Spark SQL 物理执行计划各操作实现
http://blog.csdn.net/pelick/article/details/22748841SparkStrategy: logical to physicalCatalyst作为一个实现无关的查询优化框架,在优化后的逻辑执行计划到真正的物理执行计划这部分只提供了接口,没有提供像Analyzer和Optimizer那样的实现。本文介绍的是Spark SQL组件各转载 2017-07-31 23:48:23 · 2455 阅读 · 0 评论 -
一张图读通Spark源码
http://blog.csdn.net/pelick/article/details/17222873前段时间断断续续通读了下Spark-0.8的源码,边读边画的一张大体的流程图 ,覆盖了最重要的几个模块及其关键类。希望对源码的细化阅读有所帮助。(图片比较宽,CSDN显示不给力,可以在我的微盘下载)更新:.vsd 文件链接(全文完)转载 2017-07-31 23:49:58 · 369 阅读 · 0 评论 -
Apache Spark源码走读之11 -- sql的解析与执行
http://www.cnblogs.com/hseagle/p/3752917.html欢迎转载,转载请注明出处,徽沪一郎。概要在即将发布的spark 1.0中有一个新增的功能,即对sql的支持,也就是说可以用sql来对数据进行查询,这对于DBA来说无疑是一大福音,因为以前的知识继续生效,而无须去学什么scala或其它script.一般来说任意一个sql子转载 2017-07-24 16:27:30 · 669 阅读 · 0 评论 -
Spark笔记——技术点汇总
http://www.cnblogs.com/netoxi/p/7223412.html目录· 概况· 手工搭建集群 · 引言 · 安装Scala · 配置文件 · 启动与测试· 应用部署 · 部署架构 · 应用程序部署· 核心原理 · RDD概念 · RDD核心组成 · RD转载 2017-08-02 11:58:08 · 1241 阅读 · 0 评论 -
Spark Streaming笔记——技术点汇总
http://www.cnblogs.com/netoxi/p/7223414.html目录· 概况· 原理· API · DStream · WordCount示例 · Input DStream · Transformation Operation · Output Operation · 缓存与持久化转载 2017-08-04 17:54:56 · 572 阅读 · 0 评论 -
《Spark Python API 官方文档中文版》 之 pyspark.sql (一)
http://www.cnblogs.com/wonglu/p/7784556.html摘要:在Spark开发中,由于需要用Python实现,发现API与Scala的略有不同,而Python API的中文资料相对很少。每次去查英文版API的说明相对比较慢,还是中文版比较容易get到所需,所以利用闲暇之余将官方文档翻译为中文版,并亲测Demo的代码。在此记录一下,希望对那些对Spark感转载 2017-11-04 21:07:02 · 7965 阅读 · 1 评论 -
大数据学习系列之九---- Hive整合Spark和HBase以及相关测试
https://www.cnblogs.com/xuwujing/p/8322022.html前言在之前的大数据学习系列之七 ----- Hadoop+Spark+Zookeeper+HBase+Hive集群搭建 中介绍了集群的环境搭建,但是在使用hive进行数据查询的时候会非常的慢,因为hive默认使用的引擎是MapReduce。因此就将spark作为hive的引擎来转载 2018-01-22 00:00:48 · 1234 阅读 · 0 评论 -
Spark Streaming编程指南
https://www.cnblogs.com/swordfall/p/8378000.htmlA Quick ExampleBasic ConceptsLinkingInitializing StreamingContextDiscretized Streams (DStreams)Input DStreams and ReceiversTransformations on DStreamsOu...转载 2018-02-09 16:19:44 · 567 阅读 · 0 评论 -
Spark MLlib 之 aggregate和treeAggregate从原理到应用
https://www.cnblogs.com/xing901022/p/9285898.html在阅读spark mllib源码的时候,发现一个出镜率很高的函数——aggregate和treeAggregate,比如matrix.columnSimilarities()中。为了好好理解这两个方法的使用,于是整理了本篇内容。由于treeAggregate是在aggregate基础上的优化版本,因此...转载 2018-07-09 21:45:29 · 787 阅读 · 0 评论 -
Spark(三)Spark之RDD
https://www.cnblogs.com/frankdeng/p/9301653.html一、RDD的概述1.1 什么是RDD?RDD(Resilient Distributed Dataset)叫做弹性分布式数据集,是Spark中最基本的数据抽象,它代表一个不可变、可分区、里面的元素可并行计算的集合。RDD具有数据流模型的特点:自动容错、位置感知性调度和可伸缩性。RDD允许用户在执行多个查...转载 2018-07-14 00:38:19 · 367 阅读 · 0 评论 -
Spark Streaming + Kafka集成指南
https://www.cnblogs.com/frankdeng/p/9308585.htmlKafka项目在版本0.8和0.10之间引入了一个新的消费者API,因此有两个独立的相应Spark Streaming包可用。请选择正确的包, 请注意,0.8集成与后来的0.9和0.10代理兼容,但0.10集成与早期的代理不兼容。注意:从Spark 2.3.0开始,不推荐使用Kafka 0.8支持。Sp...转载 2018-07-16 00:39:11 · 479 阅读 · 0 评论 -
SparkSql学习笔记(包含IDEA编写的本地代码)
SparkSql学习笔记(包含IDEA编写的本地代码) Spark SQL and DataFrame1.为什么要用Spark Sql原来我们使用Hive,是将Hive Sql 转换成Map Reduce 然后提交到集群上去执行,大大简化了编写MapReduce的程序的复杂性,由于MapReduce这种计算模型执行效率比较慢,所以Spark Sql的应运而生,它是将SparkSql转...转载 2018-08-22 22:55:41 · 582 阅读 · 0 评论 -
SPARK2.1.0模型设计与基本架构(下)
SPARK2.1.0模型设计与基本架构(下)https://www.cnblogs.com/jiaan-geng/p/9708246.html阅读提示:读者如果对Spark的背景知识不是很了解的话,建议首先阅读《SPARK2.1.0模型设计与基本架构(上)》一文。SPARK模型设计1. Spark编程模型正如Hadoop在介绍MapReduce编程模型时选择word count...转载 2018-10-01 17:12:28 · 420 阅读 · 0 评论 -
Spark读写HBase实践
Spark读写HBase实践https://www.jianshu.com/p/49141df754a2Spark经常会读写一些外部数据源,常见的有HDFS、HBase、JDBC、Redis、Kafka等。这些都是Spark的常见操作,做一个简单的Demo总结,方便后续开发查阅。1.1 maven依赖需要引入Hadoop和HBase的相关依赖,版本信息根据实际情况确定。 &l...转载 2019-04-10 02:04:36 · 317 阅读 · 0 评论 -
轻松理解 Spark 的 aggregate 方法
https://www.cnblogs.com/chorm590/p/spark_201904201159.html2019-04-20关键字:Spark 的 agrregate作用、Scala的 aggregate是什么Spark编程中的 aggregate方法还是比较常用的。本篇文章站在初学者的角度以大白话的形式来讲解一下 aggregate方法。agg...转载 2019-04-21 12:14:12 · 593 阅读 · 0 评论 -
大数据技术之_19_Spark学习_06_Spark 源码解析 + Spark 通信架构、脚本解析、standalone 模式启动、提交流程 + Spark Shuffle 过程 + Spark 内存
https://www.cnblogs.com/chenmingjun/p/10803261.html文章目录第1章 Spark 整体概述 1.1 整体概念 1.2 RDD 抽象 1.3 计算抽象 1.4 集群模式 1.5 RPC 网络通信抽象 1.6 启动 Standalone 集群 1.7 核心组件 1.8 核心组件交互流程 1.9 Block 管理...转载 2019-05-04 22:50:35 · 2438 阅读 · 1 评论 -
MapReduce Shuffle 和 Spark Shuffle 原理概述
https://www.cnblogs.com/xiaodf/p/10650921.htmlShuffle简介Shuffle的本意是洗牌、混洗的意思,把一组有规则的数据尽量打乱成无规则的数据。而在MapReduce中,Shuffle更像是洗牌的逆过程,指的是将map端的无规则输出按指定的规则“打乱”成具有一定规则的数据,以便reduce端接收处理。其在MapReduce中所处的工作阶段是m...转载 2019-05-11 14:52:05 · 659 阅读 · 0 评论 -
spark 源码分析之十八 -- Spark存储体系剖析
目录总述 SecurityManager 概述 类结构 成员变量 核心方法 总结 BlockManagerMaster 概述 类结构 成员变量 ShuffleClient 类说明 核心方法 BlockTransferService 类说明 核心方法 ManagedBuffer的三个子类 NettyBlockTransfer...转载 2019-07-24 00:54:30 · 460 阅读 · 0 评论 -
Spark修炼之道(进阶篇)——Spark入门到精通:第十四节 Spark Streaming 缓存、Checkpoint机制
Spark修炼之道(进阶篇)——Spark入门到精通:第十四节 Spark Streaming 缓存、Checkpoint机制】主要内容http://blog.csdn.net/lovehuangjiaju/article/details/50102831本节内容基于官方文档:http://spark.apache.org/docs/latest/strea转载 2015-12-01 17:37:48 · 2751 阅读 · 1 评论 -
Spark SQL利器:cacheTable/uncacheTable
http://www.cnblogs.com/yurunmiao/p/4936583.htmlSpark相对于Hadoop MapReduce有一个很显著的特性就是“迭代计算”(作为一个MapReduce的忠实粉丝,能这样说,大家都懂了吧),这在我们的业务场景里真的是非常有用。 假设我们有一个文本文件“datas”,每一行有三列数据,以“\t”分隔,模拟生成文件的代码如下:转载 2015-11-04 21:09:03 · 1105 阅读 · 0 评论 -
Spark 数据挖掘 - 利用决策树预测森林覆盖类型
http://my.oschina.net/u/1244232/blog/525145摘要 Spark 数据挖掘 利用决策树预测森林覆盖类型Spark 数据挖掘 决策树目录[-]Spark 数据挖掘—利用决策树预测森林覆盖类型1 前言2 一些基本概念3 算法简介决策树4 数据集5 Spark 决策树模型6 决策树参转载 2015-11-04 21:21:35 · 3412 阅读 · 0 评论 -
使用docker安装部署Spark集群来训练CNN(含Python实例)
本博客仅为作者记录笔记之用,不免有很多细节不对之处。还望各位看官能够见谅,欢迎批评指正。博客虽水,然亦博主之苦劳也。如需转载,请附上本文链接,不甚感激! http://blog.csdn.net/cyh_24/article/details/49683221实验室有4台神服务器,每台有8个tesla-GPU,然而平时做实验都只使用了其中的一个GPU,实在暴遣天物! 于是转载 2015-11-07 17:05:50 · 2312 阅读 · 0 评论 -
Spark RCFile的那些“坑”
http://www.cnblogs.com/yurunmiao/p/4956139.htmlRCFile在平台的应用场景中多数用于存储需要“长期留存”的数据文件,在我们的实践过程中,RCFile的数据压缩比通常可以达到8 : 1或者10 : 1,特别适用于存储用户通过Hive(MapReduce)分析的结果。目前平台的计算引擎正逐步由Hadoop MapReduce迁移至Sp转载 2015-11-11 21:17:35 · 2752 阅读 · 0 评论 -
Spark RDD Persistence
http://www.cnblogs.com/yurunmiao/p/4966393.htmlSpark最为重要的特性之一就是可以在多个操作(Action)之间,将一个或多个RDD关联的数据集(Dataset)以分区(Partition)为单位进行持久化(Persist)或缓存(Cache),存储介质通常是内存(Memory)。 被持久化或缓存的RDD A可以在两种情况下被转载 2015-11-15 14:05:18 · 2109 阅读 · 1 评论 -
【精】从入门到高深,史上最全的Spark综合帖
http://dataunion.org/2824.html什么是SparkSpark是UC Berkeley AMP lab所开源的类Hadoop MapReduce的通用的并行计算框架,Spark基于map reduce算法实现的分布式计算,拥有Hadoop MapReduce所具有的优点;但不同于MapReduce的是Job中间输出和结果可以保存在内存中,从而不再需要读写HDFS转载 2015-11-22 13:57:39 · 870 阅读 · 0 评论 -
Spark 中的RDD是个什么鬼,我们为什么需要它?
Spark 中的RDD是个什么鬼,我们为什么需要它?2015-11-02 小象译者:付军原文链接:https://dzone.com/articles/what-is-rdd-in-spark-and-why-do-we-need-it小象科技原创作品,欢迎大家疯狂转发;机构、自媒体平台转载务必至后台留言,申请版权。Spark 中的R转载 2015-11-03 09:22:41 · 2169 阅读 · 0 评论 -
Spark(Hive) SQL中UDF的使用(Python)
http://www.cnblogs.com/yurunmiao/p/4931095.html相对于使用MapReduce或者Spark Application的方式进行数据分析,使用Hive SQL或Spark SQL能为我们省去不少的代码工作量,而Hive SQL或Spark SQL本身内置的各类UDF也为我们的数据处理提供了不少便利的工具,当这些内置的UDF不能满足于我们转载 2015-11-02 21:42:56 · 4672 阅读 · 0 评论 -
Apache Spark大数据分析入门(一)
http://www.csdn.net/article/2015-11-25/2826324?ref=myread摘要:Apache Spark的出现让普通人也具备了大数据及实时数据分析能力。鉴于此,本文通过动手实战操作演示带领大家快速地入门学习Spark。本文是Apache Spark入门系列教程(共四部分)的第一部分。Apache Spark的出现让普通人也具备了大数据转载 2015-11-26 00:07:06 · 1250 阅读 · 0 评论
分享