自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(6)
  • 收藏
  • 关注

原创 MySql的常用引擎

在MySQL数据库中,常用的引擎主要就是2个:Innodb和MyIASM。首先:1.简单介绍这两种引擎,以及该如何去选择。2.这两种引擎所使用的数据结构是什么。a.Innodb引擎,Innodb引擎提供了对数据库ACID事务的支持。并且还提供了行级锁和外键的约束。它的设计的目标就是处理大数据容量的数据库系统。它本身实际上是基于Mysql后台的完整的系统。Mysql运行的时候,Inno...

2019-04-02 23:11:49 149

转载 Redis持久化方式

1、前言Redis是一种高级key-value数据库。它跟memcached类似,不过数据可以持久化,而且支持的数据类型很丰富。有字符串,链表,集 合和有序集合。支持在服务器端计算集合的并,交和补集(difference)等,还支持多种排序功能。所以Redis也可以被看成是一个数据结构服务 器。Redis的所有数据都是保存在内存中,然后不定期的通过异步方式保存到磁盘上(这称为“半持久化模式”)...

2019-04-02 23:09:41 89

转载 HDFS读写流程

概述开始之前先看看其基本属性,HDFS(Hadoop Distributed File System)是GFS的开源实现。特点如下:能够运行在廉价机器上,硬件出错常态,需要具备高容错性流式数据访问,而不是随机读写面向大规模数据集,能够进行批处理、能够横向扩展简单一致性模型,假定文件是一次写入、多次读取缺点:不支持低延迟数据访问不适合大量小文件存储(因为每条元数据占用空间是一定的)...

2019-03-13 17:42:31 164

原创 SparkStreaming+Kafka的两种模式receiver模式和Direct模式

SparkStreaming+Kafka的两种模式receiver模式和Direct模式一、前述SparkStreamin是流式问题的解决的代表,一般结合kafka使用,所以本文着重讲解sparkStreaming+kafka两种模式。二、具体1、Receiver模式原理图:receiver模式理解:在SparkStreaming程序运行起来后,Executor中会有receiver...

2019-02-16 08:53:50 311

原创 【总结】论spark中的cache/persist/checkpoint

cache与persistcache 能够让重复数据在同一个 application 中的 jobs 间共享。RDD的cache()方法其实调用的就是persist方法,缓存策略均为MEMORY_ONLY。下面简单引入一下cache的机制:哪些 RDD 需要 cache?会被重复使用的(但不能太大)。用户怎么设定哪些 RDD 要 cache?因为用户只与 driver progra...

2019-01-26 04:36:44 156

原创 Spark算子总结

Spark算子总结转换算子:针对集合的操作并集:union 使用了UnionRDD,将两个RDD的分区合并到一个RDD中,循环每个RDD的迭代器取数。差集:subtract 底层调用subtractByKey算子,产生shuffle交集:intersection 底层调用cogroup算子,产生shuffle笛卡尔积:cartesian 两个集合一一关联产生新的pair对cogrou...

2019-01-25 11:01:59 203

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除