Spark
凝眸伏笔
纵然伤心也不要愁眉不展,因为你不知道谁会爱上你的笑容。
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
【Spark】计算两个文件中每一行的相似度,并返回top10
背景: 在向量大火的行情下,不管是召回还是精排,user和item的相似度计算,必不可少;很多情况下,为了节省线上加载计算的时间,会将user和item的向量,离线计算好,放到存储系统中,线上使用的时候,直接通过KV的形式读取。(没有AB过会节省多少时间,在排序服务中,直接将二者向量导入KV存储系统,直接在线上进行计算,目测也没有增加多少耗时) 先来看看离线如何计算。通常使用spark进行大量的数据计算。其优势见spark优势。 例子: 假设t1.text中存放user的向量,用逗号分隔,形如:原创 2020-06-09 22:32:47 · 2294 阅读 · 0 评论 -
【大数据】计算引擎之一:什么是数据处理框架
学习笔记~~ 大数据是收集、整理、处理大容量数据集,并从中获得见解所需的非传统战略和技术的总称。虽然处理数据所需的计算能力或存储容量早已超过一台计算机的上限,但这种计算类型的普遍性、规模,以及价值在最近几年才经历了大规模扩展。 大数据系统一个最基本的组件:处理框架。处理框架负责对系统中的数据进行计算,例如处理从非易失存储中读取的数据,或处理刚刚摄入到系统中的数据。数据的计算则是指从大量单一数据...原创 2019-11-09 17:17:16 · 944 阅读 · 0 评论 -
【大数据】计算引擎之七:Flink处理框架
1.是什么? Apache Flink是一种可以处理批处理任务的流处理框架。该技术可将批处理数据视作具备有限边界的数据流,借此将批处理任务作为流处理的子集加以处理。为所有处理任务采取流处理为先的方法会产生一系列有趣的副作用。 这种流处理为先的方法也叫做Kappa架构,与之相对的是更加被广为人知的Lambda架构(该架构中使用批处理作为主要处理方法,使用流作为补充并提供早期未经提炼的结果)。...原创 2019-11-09 17:38:41 · 809 阅读 · 3 评论 -
【大数据】计算引擎之六:Spark处理框架
1.是什么? Apache Spark是一种包含流处理能力的下一代批处理框架。与Hadoop的MapReduce引擎基于各种相同原则开发而来的Spark主要侧重于通过完善的内存计算和处理优化机制加快批处理工作负载的运行速度。 原理图: 2.怎么干? Spark可作为独立集群部署(需要相应存储层的配合),或可与Hadoop集成并取代MapReduce引擎。 批处理模式 与M...原创 2019-11-09 17:36:49 · 1716 阅读 · 0 评论 -
【大数据】计算引擎之五:Samza处理框架
这里主要还是说kafka的事情,samza依赖kafka。 1.是什么? Apache Samza是一种与Apache Kafka消息系统紧密绑定的流处理框架。虽然Kafka可用于很多流处理系统,但按照设计,Samza可以更好地发挥Kafka独特的架构优势和保障。该技术可通过Kafka提供容错、缓冲,以及状态存储。 2.怎么干? Samza可使用YARN作为资源管理器。这意味着默认情况...原创 2019-11-09 17:34:09 · 1004 阅读 · 0 评论 -
【大数据】计算引擎之四:Storm处理框架
1.是什么? Apache Storm是一种侧重于极低延迟的流处理框架,也许是要求近实时处理的工作负载的最佳选择。该技术可处理非常大量的数据,通过比其他解决方案更低的延迟提供结果。 2.怎么干? 流处理模式 Storm的流处理可对框架中名为Topology(拓扑)的DAG(Directed Acyclic Graph,有向无环图)进行编排。这些拓扑描述了当数据片段进入系统后,需要对...原创 2019-11-09 17:29:28 · 792 阅读 · 0 评论 -
【大数据】计算引擎之三:Hadoop处理框架
1.什么是hadoop处理框架? Apache Hadoop是一种专用于批处理的处理框架。Hadoop是首个在开源社区获得极大关注的大数据框架。基于谷歌有关海量数据处理所发表的多篇论文与经验的Hadoop重新实现了相关算法和组件堆栈,让大规模批处理技术变得更易用。 2.hadoop框架包含哪些组件及其功能 新版Hadoop包含多个组件,即多个层,通过配合使用可处理批数据: HDFS:主...原创 2019-11-09 17:27:17 · 1819 阅读 · 0 评论 -
【大数据】计算引擎之二:数据处理三种类型
在深入介绍不同实现的指标和结论之前,首先需要对不同处理类型的概念进行一个简单的介绍。 1.批处理系统 批处理在大数据世界有着悠久的历史。批处理主要操作大容量静态数据集,并在计算过程完成后返回结果。 批处理模式中使用的数据集通常符合下列特征... 有界:批处理数据集代表数据的有限集合 持久:数据通常始终存储在某种类型的持久存储位置中 大量:批处理操作通常是处理...原创 2019-11-09 17:21:37 · 6682 阅读 · 0 评论 -
Spark 运行内存溢出问题:memoryOverhead issue in Spark
当用Spark和Hadoop做大数据应用的时候,你可能会反复的问自己怎么解决这一的一个问题:“Container killed by YARN for exceeding memory limits. 16.9 GB of 16 GB physical memory used. Consider boosting spark.yarn.executor.memoryOverhead”这个错...翻译 2018-05-18 18:50:08 · 33740 阅读 · 0 评论 -
Hive 基础优化
做数据处理工作,尝尝会用到hive SQL处理数据,这就涉及到了效率问题,一个表跑了两个多小时也是等的让人心醉,耽误工作,于是想着优化一些参数,还有sql代码,查询了一些方法,记录在此,遇见新的方法再更新....下面这些方法都是用过的,确认好用的,提升了工作效率的方法,可放心采用。1 使用分区剪裁、列剪裁在SELECT中,只拿需要的列,如果有,尽量使用分区过滤,少用SELECT *。在分区剪裁中,...原创 2018-05-25 16:18:15 · 273 阅读 · 0 评论 -
Spark中Map、Shulffe、Reduce的含义解释
初入spark门,会出现这些名词,半年了我表示都没有很名表这些词的意思,在具体工作中指代什么环节。今天看了这个博客突然顿悟....摘下重点。1.Map阶段读取源表的数据,Map输出时候以Join on条件中的列为key,如果Join有多个关联键,则以这些关联键的组合作为key;Map输出的value为join之后所关心的(select或者where中需要用到的)列;同时在value中还会包含表的T...原创 2018-05-25 18:20:17 · 1242 阅读 · 0 评论 -
Hive常用函数总结(datediff、pmod、from_unixtime、instr、split、concat、cast、contact_ws、collect_set、row_numb)
datediff、pmod、from_unixtime、hour、instr、split、concat、cast、contact_ws、collect_set、row_number、group_concat、Coalesce、str_to_map、get_json_object等函数的用法汇总原创 2018-06-03 15:53:12 · 8803 阅读 · 0 评论 -
Spark系列——Spark性能调优:资源优化
在前辈们的基础上,本人根据自己在实际操作中又补充了一些内容,参考链接见最后。欢迎交流~~~ 在开发完Spark作业之后,就该为作业配置合适的资源了。Spark的资源参数,基本都可以在spark-submit命令中作为参数设置。很多Spark初学者,通常不知道应该设置哪些必要的参数,以及如何设置这些参数,最后就只能胡乱设置,甚至压根儿不设置。资源参数设置的不合理,可能会导致没有充分利用集群资源...原创 2018-05-16 11:47:18 · 376 阅读 · 0 评论 -
ALS 在 Spark MLlib 中的实现
深受用户喜爱的大数据处理平台ApacheSpark1.3于前不久发布,MLlib作为Spark负责机器学习 (ML) 的核心组件在1.3中添加了不少机器学习及数据挖掘的算法:研究主题分布的latentDirichletallocation (LDA)、估计点集分布的高斯混合模型 (GMM)、提取频繁项集的FP-growth、生成图聚类的poweriteratio...原创 2018-05-16 15:14:18 · 8005 阅读 · 0 评论 -
hive--row_number() 组内排序函数
1.要解决的问题 相对用一次请求得到的item的粗排进行排序,平时得到的粗排结果是[0,1]之间的一个值,但是想将其转换为index的形式。 2.解决方案 hive中的函数row_number() 使用方法: select COLUMN_A,COLUMN_B, row_number() OVER (partition BY COLUMN_A ORDER BY COLUMN_B ASC...原创 2018-10-18 11:47:46 · 3811 阅读 · 0 评论 -
SQL --JOIN相关
join: SQL INNER JOIN 从多个表中返回满足 JOIN 条件的所有行。INNER JOIN 与 JOIN 是相同的。 x INNER JOIN 关键字在表中存在至少一个匹配时返回行。如果 "Websites" 表中的行在 "access_log" 中没有匹配,则不会列出这些行。 ...原创 2018-10-22 18:01:48 · 223 阅读 · 0 评论
分享