目录
一、OLAP 平台概述
二、OLAP平台需求示例
三、Presto集群搭建
多易教育,专注大数据培训; 课程引领市场,就业乘风破浪
多易教育官网地址
https://www.51doit.cn
多易教育在线学习平台
https://v.51doit.cn
一、OLAP 平台概述
OLAP: 联机在线数据分析系统
olap平台是提供给运营人员进行各种联机数据分析的人性化平台
按照查询类型划分,OLAP一般分为即席查询和固化查询,
即席查询:通过手写sql完成一些临时的数据分析需求,这类sql形式多变、逻辑复杂,对查询时间没有严格要求
固化查询:指的是一些固化下来的取数、看数需求,通过数据产品的形式提供给用户,从而提高数据分析和运营的效率。这类的sql固定模式,对响应时间有较高要求。
按照架构实现划分,主流的OLAP引擎主要有下面三点:
MPP架构系统(Presto/Impala/SparkSQL/Drill等)。这种架构主要还是从查询引擎入手,使用分布式查询引擎,而不是使用hive+mapreduce架构,提高查询效率。
搜索引擎架构的系统(es,solr等),在入库时将数据转换为倒排索引,采用Scatter-Gather计算模型,牺牲了灵活性换取很好的性能,在搜索类查询上能做到亚秒级响应。但是对于扫描聚合为主的查询,随着处理数据量的增加,响应时间也会退化到分钟级。
预计算系统(Druid/Kylin等)则在入库时对数据进行预聚合,进一步牺牲灵活性换取性能,以实现对超大数据集的秒级响应。
本项目olap的技术选型:
底层存储层:hive
中间查询层:presto(既能满足固化查询,也能满足即席查询)
(类似产品: clickhouse—俄罗斯,c语言开发的; druid—apache项目;都可以做联机数据分析OLAP!)
之所选择presto,是因为它支持海量数据的复杂、随机、实时查询,且能够非常方便地与现有系统中的数据源进行无缝对接!
平台界面层:springboot+前端
二、OLAP平台需求示例
本OLAP平台上提供的数据分析主要有两种
常规报表数据的实时查询分析
分析的数据源于hive固定批处理任务每天定时运行的结果
自定义报表的联机实时分析
分析的数据源于presto对hive中的数据进行实时自定义计算
三、Presto集群搭建
详见《【多易教育】-Presto教程-v1.0》
多易教育,专注大数据培训; 课程引领市场,就业乘风破浪
多易教育官网地址
https://www.51doit.cn
多易教育在线学习平台
https://v.51doit.cn