hadoop中的排序新思路-附基于spark之上的性能测试

原创 2017年03月07日 10:29:17
           排序可以说是很多日志系统的硬指标(如按照时间逆序排序),如果一个大数据系统不能进行排序,基本上是这个系统属于不可用状态,排序算得上是大数据系统的一个“刚需”,无论大数据采用的是hadoop,还是spark,还是impala,hive,总之排序是必不可少的,排序的性能测试也是必不可少的。

       有着计算奥运会之称的Sort Benchmark全球排序每年都会举行一次,每年巨头都会在排序上进行巨大的投入,可见排序速度的高低有多么重要!但是对于大多数企业来说,动辄上亿的硬件投入,实在划不来、甚至远远超出了企业的项目预算。相比大数据领域的暴力排序有没有一种更廉价的实现方式?


  在这里,我们为大家介绍一种新的廉价排序方法,我们称为blockSort。

     500G的数据300亿条数据,只使用4台 16核,32G内存,千兆网卡的虚拟机即可实现 2~15秒的 排序 (可以全表排序,也可以与任意筛选条件筛选后排序)。
   

   一、基本的思想是这样的,如下图所示:

    1.将数据按照大小预先划分好,如划分成 大、中、小三个块(block)。

    2.如果想找最大的数据,那么只需要在最大的那个块里去找就可以了。

     3.这个快还是有层级结构的,如果每个块内的数据量很多,可以到下面的子快内进行继续查找,可以分多个层进行排序。

    4.采用这种方法,一个亿万亿级别的数据(如long类型),最坏最坏的极端情况也就进行2048次文件seek就可以筛选到结果。


怎么样,原理是不是非常简单,这样数据量即使特别多,那么排序与查找的次数是固定的。


  二、这个是我们之前基于spark做的性能测试,供大家参考


在排序上,YDB具有绝对优势,无论是全表,还是基于任意条件组合过滤,基本秒杀Spark任何格式。

 

测试结果(时间单位为秒)



测试过程视频地址 

https://v.qq.com/x/page/q0371wjj8fb.html

https://v.qq.com/x/page/n0371l0ytji.html

感兴趣的读者也可以阅读YDB编程指南 http://url.cn/42R4CG8 。也可以参考该书自己安装延云YDB进行测试。


三、当然除了排序上,我们的其他性能也是远远高于spark,这块大家也可以了解一下

1、与Spark txt在检索上的性能对比测试

注释:备忘。下图的这块,其实没什么特别的,只不过由于YDB本身索引的特性,不想spark那样暴力,才会导致在扫描上的性能远高于spark,性能高百倍不足为奇。


 下图为ydb相对于spark txt提升的倍数


2、这些是与 Parquet 格式对比(单位为秒) 
这里写图片描述 
这里写图片描述 
这里写图片描述 
这里写图片描述 
这里写图片描述 
这里写图片描述 
这里写图片描述

3、与ORACLE性能对比

跟传统数据库的对比,已经没啥意义,Oracle不适合大数据,任意一个大数据工具都远超oracle 性能。

 


4.稽查布控场景性能测试


四、YDB是怎么样让spark加速的?

     基于Hadoop分布式架构下的实时的、多维的、交互式的查询、统计、分析引擎,具有万亿数据规模下的秒级性能表现,并具备企业级的稳定可靠表现。

      YDB是一个细粒度的索引,精确粒度的索引。数据即时导入,索引即时生成,通过索引高效定位到相关数据。YDB与Spark深度集成,Spark对YDB检索结果集直接分析计算,同样场景让Spark性能加快百倍。




 

五、哪些用户适合使用YDB?


1.传统关系型数据,已经无法容纳更多的数据,查询效率严重受到影响的用户。

2.目前在使用SOLR、ES做全文检索,觉得solr与ES提供的分析功能太少,无法完成复杂的业务逻辑,或者数据量变多后SOLR与ES变得不稳定,在掉片与均衡中不断恶性循环,不能自动恢复服务,运维人员需经常半夜起来重启集群的情况。

3.基于对海量数据的分析,但是苦于现有的离线计算平台的速度和响应时间无满足业务要求的用户。

4.需要对用户画像行为类数据做多维定向分析的用户。

5.需要对大量的UGC(User Generate Content)数据进行检索的用户。

6.当你需要在大数据集上面进行快速的,交互式的查询时。

7.当你需要进行数据分析,而不只是简单的键值对存储时。

8.当你想要分析实时产生的数据时。


ps: 说了一大堆,说白了最适合的还是踪迹分析因为数据量大,数据还要求实时,查询还要求快。这才是关键。






视频地址 (看不清的同学可以进入腾讯视频 高清播放)

https://v.qq.com/x/page/q0371wjj8fb.html

https://v.qq.com/x/page/n0371l0ytji.html

感兴趣的读者也可以阅读YDB编程指南 http://url.cn/42R4CG8 。也可以参考该书自己安装延云YDB进行测试。


700多万hadoophive和spark性能测试

------------------rdd--------------- val rdd = sc.textFile("hdfs://master:9000/spark/SogouQ/") rdd.c...
  • china_demon
  • china_demon
  • 2016-09-10 08:03:29
  • 801

spark的性能测试

一直在使用hive做分布式大数据查询工作,越来越发现做为一个离线查询数据库来说,这样的效率真的是让人抓狂啊。网上说spark的性能是非常优越的,所以做了个环境安装了个,在centos的虚拟机上跑一下,...
  • LanSeTianKong12
  • LanSeTianKong12
  • 2016-08-01 09:58:53
  • 2064

Hadoop vs Spark性能对比

转载自:http://www.cnblogs.com/jerrylead/archive/2012/08/13/2636149.html 基于Spark-0.4和Hadoop-0.20.2 ...
  • u012377333
  • u012377333
  • 2016-04-20 10:47:47
  • 580

win10 系统 eclipse配置scala+spark开发环境

第一步:安装JDK    (1)下载JDK(1.7以上版本)       下载地址:http://www.oracle.com/technetwork/java/javase/downlo...
  • hh13248101160
  • hh13248101160
  • 2017-09-27 23:00:06
  • 272

在windows中搭建spark单机版

虽然要学习spark,选择linux的版本更合适,之前在台式机上配置了centos的虚拟机并安装了hadoop和spark,可是无奈笔记本性能不行,如果安装虚拟机会很卡,所以只能在windows中安装...
  • slibra_L
  • slibra_L
  • 2017-09-07 10:11:19
  • 526

hadoop中的排序新思路-附基于spark之上的性能测试

排序可以说是很多日志系统的硬指标(如按照时间逆序排序),如果一个大数据系统不能进行排序,基本上是这个系统属于不可用状态,排序算得上是大数据系统的一个“刚需”,无论大数据采用的是hadoop,还是spa...
  • muyannian
  • muyannian
  • 2017-03-07 10:29:17
  • 579

Hadoop+spark+hive全分布环境的搭建

一、基础环境配置 我采用的是三台虚拟主机,操作系统为centos7。hadoop版本为2.6  、hive2.1.1版本为(可自行到官网下载)、jdk7、Scala2.11.0、zookeeper3...
  • zwx886688
  • zwx886688
  • 2017-11-26 19:54:49
  • 578

Hadoop和Spark分别实现二次排序

将下列数据中每个分区中的第一列顺序排列,第二列倒序排列。 Text  1 2 3 4 5 6 7 8 9 10 11 12 13 14 15...
  • guohecang
  • guohecang
  • 2016-05-03 21:33:43
  • 1037

Hadoop经典案例Spark实现(三)——数据排序

Hadoop经典案例Spark实现(三)——数据排序
  • kwu_ganymede
  • kwu_ganymede
  • 2016-01-07 13:50:53
  • 2479

Hive查询性能测试记录

一、测试环境 HDFS 七个节点,五个dn,两个nn。Hive配置在其中一个nn,使用MySQL远程元数据库,同一个节点同时开启hiveserver2和metastore。所有节点内存一致,30...
  • ZHBR_F1
  • ZHBR_F1
  • 2017-05-27 14:16:49
  • 1342
收藏助手
不良信息举报
您举报文章:hadoop中的排序新思路-附基于spark之上的性能测试
举报原因:
原因补充:

(最多只允许输入30个字)