2018年09月_qq_43119740

12月 11月 09月

转载 yarn学习

1）作业提交 client调用job.waitForCompletion方法，向整个集群提交MapReduce作业 (第1步) 。新的作业ID(应用ID)由资源管理器分配(第2步). 作业的client核实作业的输出, 计算输入的split,将作业的资源(包括Jar包, 配置文件, split信息)拷贝给HDFS(第3步). 最后, 通过调用资源管理器的submitApplica...

2018-09-04 20:19:10 81

SparkSQL总体流程介绍在阐述Join实现之前，我们首先简单介绍SparkSQL的总体流程，一般地，我们有两种方式使用SparkSQL，一种是直接写sql语句，这个需要有元数据库支持，例如Hive等，另一种是通过Dataset/DataFrame编写Spark应用程序。如下图所示，sql语句被语法解析(SQL AST)成查询计划，或者我们通过Dataset/DataFrame提供的APIs...

2018-09-03 19:38:16 301

转载 spark调优

1、Spark调优背景目前Zeppelin已经上线一段时间，Spark作为底层SQL执行引擎，需要进行整体性能调优，来提高SQL查询效率。本文主要给出调优的结论，因为涉及参数很多，故没有很细粒度调优，但整体调优方向是可以得出的。环境：服务器600+，spark 2.0.2，Hadoop 2.6.0 2、调优结果调优随机选取线上9条SQL，表横轴是调优测试项目，测试在集群空闲情况下进行...

2018-09-03 19:19:35 90

转载大数据学习-用户画像

一、什么是用户画像用户画像是指根据用户的属性、用户偏好、生活习惯、用户行为等信息而抽象出来的标签化用户模型。通俗说就是给用户打标签，而标签是通过对用户信息分析而来的高度精炼的特征标识。通过打标签可以利用一些高度概括、容易理解的特征来描述用户，可以让人更容易理解用户，并且可以方便计算机处理。用户画像是对现实世界中用户的建模，用户画像应该包含目标，方式，组织，标准，验证这5个方面。...

2018-09-03 12:30:01 1614

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

qq_43119740的博客

转载 yarn学习

转载 SparkSQL总体流程介绍

转载 spark调优

转载大数据学习-用户画像

空空如也

空空如也

转载 yarn学习

转载 SparkSQL总体流程介绍

转载 spark调优

转载 大数据学习-用户画像

空空如也

空空如也

转载大数据学习-用户画像