Hadoop数据仓库hive的基本知识

本文介绍了数据仓库的基本概念,包括数据源、数据集成、数据存储和管理、数据服务以及数据应用。接着讨论了传统数据仓库的不足之处,并重点讲解了Hive在Hadoop生态系统中的角色和它与其它组件的关系,以及Hive与传统数据库的主要区别。
摘要由CSDN通过智能技术生成
  Hive是基于Hadoop的数据仓库工具,可对存储在HDFS上的文件中的数据集进行数据整理、特殊查询和分析处理,提供了类似于SQL语言的查询语言–HiveQL,可通过HQL语句实现简单的MR统计,Hive将HQL语句转换成MR任务进行执行。

一:概述

1.1 数据仓库概念

 数据仓库是一个面向主题的、集成的、相对稳定的、反应历史变化的数据集合,用于支持管理决策。

数据仓库体系结构通常含四个层次:数据源,数据存储和管理,数据服务,数据应用。

数据源:是数据仓库的数据来源,含外部数据,现有业务系统和文档资料等。
数据集成:完成数据的抽取、清洗、转换和加载任务、数据源中的数据采用ETL工具以固定的周期加载到数据仓库中
数据存储和管理:此层次主要涉及对数据的存储和管理,含数据仓库、数据集市、数据仓库检测、运行和维护工具和元数据管理等
数据服务:为前端和应用提供数据服务,可直接从数据仓库中获取数据供前端应用使用,也可以OLAP(联机分析处理)服务器为前端应用提供负责的数据服务。
数据应用:此层次直接面向用户,含数据查询工具,自由报表工具,数据分析工具,数据挖掘工具和各类应用系统

1.2 传统数据仓库的弊端

    1.无法满足快速增长的海量数据存储需求,传统数据仓库基于关系型数据库,横向扩展较差ÿ
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值