Hive相关学习指南
Hive官网:http://hive.apache.org
Hive入门指南:http://wiki.apache.org/hadoop/Hive/GettingStarted
HQL查询语言指南:http://wiki.apache.org/hadoop/Hive/HiveQL
演示文稿:http://wiki.apache.org/hadoop/Hive/Presentations
第一章 概述
1-1 课程概述
Hive是基于Hadoop HDFS之上的数据仓库。
数据仓库:本质上就是一个数据库。但有别于我们通常意义上的数据库
Hive安装有3种方式。
Hadoop和Hive都是基于Linux操作系统构建的,所以要有熟悉掌握Linux下操作命令。
1-2 数据仓库简介
①数据仓库是一个面向主题的、集成的、不可更新的、随时间不变化的数据集合,它用于支持企业或组织的决策分析处理。
面向主题:主题是指用户使用数据仓库时关心的重点内容。
集成的:数据仓库可将不同类型数据库管理系统中的数据集成起来保存。
不可更新的:数据仓库一般只做数据查询,不做更新、删除等操作。
②数据仓库的结构和建立过程:数据源(可能来源于业务数据库系统、文档资料和其他数据)——>数据存储及管理(ETL:抽取、转换、装载)——>数据仓库引擎(不同的服务器有不同的功能)——>前端展示(数据查询、数据报表、数据分析、各类应用)
OLTP应用:典型应用-银行转账
OLAP应用:典型应用-商品推荐系统
数据仓库的数据模型:星型模型和雪花模型
1-3 什么是Hive
①Hive是建立在Hadoop HDFS上的数据仓库基础架构。而传统的Oracle或MySQL数据仓库是直接建立在Oracle或MySQL数据库之上的。
②Hive可以用来进行数据提取、转化、加载(ETL)。
③Hive定义了简单的类似SQL查询语言,称为HQL它允许熟悉SQL的用户查询数据。
④Hive允许熟悉MapReduce开发者的开发自定义的mapper和reducer来处理內建mapper和reducer无法完成的复杂的分析工作。
⑤Hive的SQL解析引擎,它将SQL语句转移成M/R Job然后在Hadoop上执行。
⑥Hive的表其实就是HDFS的目录/文件。
第二章 Hive的体系结构
2-1 Hive的体系结构之元数据
Hive讲元数据存储在数据库中(metastore),支持mysql、de