一、产生背景
Hive 由 Facebook 实现并开源,是基于 Hadoop 的一个数据仓库工具,可以将结构化的数据 映射为一张数据库表,并提供 HQL(Hive SQL)查询功能,底层数据是存储在 HDFS 上。Hive 的本质是将 SQL 语句转换为 MapReduce 任务运行,使不熟悉 MapReduce 的用户很方便地利用 HQL 处理和计算 HDFS 上的结构化的数据,适用于离线的批量数据计算。
Hive 依赖于 HDFS 存储数据,Hive 将 HQL 转换成 MapReduce 执行。所以说 Hive 是基于 Hadoop 的一个数据仓库工具,实质就是一款基于 HDFS 的 MapReduce 计算框架,对存储在HDFS上的数据进行分析和管理。
二、Hive的特点
1. Hive是基于Hadoop的一个数据仓库工具。与数据库不同,数据仓库是读模式,采用分布式存储,主要用于数据的读取与管理。
2. Hive可以将结构化数据映射为一张数据库表。Hive仅仅相当于HDFS上结构化数据的管理工具,将HDFS上的结构化数据映射为一张二维表。Hive只能处理结构化数据,不能完全取代MR。
3. Hive管理的原始数据存储在HDFS上,Hive只相当于HDFS上数据的管