大数据实训第三天--Hive

本文探讨了数据仓库和数据库的概念、特点以及它们之间的区别,包括数据仓库的三层架构和在数据库操作中的具体步骤,如在IDEA中使用ApacheHive和MySQL进行数据库管理,以及HDFS的关系。
摘要由CSDN通过智能技术生成

一·数据仓库和数据库

1·数据仓库和数据库的概念及特点

        数据仓库(分析型处理)是一个用于存储和管理大量数据的系统,通常用于支持企业的决策制定和分析。通常是面向用户交易的处理系统。其主要特征是面向主题的(Subject-Oriented )、集成的(Integrated)、非易失的(Non-Volatile)和时变的(Time-Variant )。

        数据库(操作型处理)是一个用于存储和管理数据的系统,通常用于支持应用程序的数据存储和访问。是面向专业分析人员进行数据分析,通常进行查询分析操作。

2 ·数据仓库和数据库的区别

数据库是面向事务的设计,数据仓库是面向主题设计的。

数据库一般存储业务数据,数据仓库存储的一般是历史数据。

数据库是为捕获数据而设计,数据仓库是为分析数据而设计。

数据库设计是尽量避免冗余,一般针对某一业务应用进行设计,符合业务应用,但是不符合分析。

数据仓库在设计是有意引入冗余,依照分析需求,分析维度、分析指标进行设计。

3·数据仓库的架构

分为三层分别为源数据层,数据仓库层,数据应用层。

二·数据库的操作

1·操作前需要的步骤

需要在IDEA上进行操作

在这里面建立Apache Hive和MySQL进行数据库的操作。

2·数据库的基本操作

创建数据库
create database if not exists myhive;
use myhive;
查看数据库详细信息
desc database myhive;
创建数据库并指定hdfs存储位置
create database myhive2 location '/myhive2';
使用location关键字,可以指定数据库在HDFS的存储路径。
删除一个空数据库,如果数据库下面有数据表,那么就会报错
drop database myhive;
强制删除数据库,包含数据库下面的表一起删除
drop database myhive2 cascade;
一些基本语法
1. 创建库的语法为
CREATE DATABASE [IF NOT EXISTS] db_name [LOCATION position];
2. 删除库的语法为
DROP DATABASE db_name [CASCADE];
3. 数据库和HDFS的关系
Hive的库在HDFS上就是一个以.db结尾的目录
默认存储在: /user/hive/warehouse
可以通过 LOCATION 关键字在创建的时候指定存储目录

        其中【】里代表可写可不写,EXTERNAL是创建外部表,col_name是列名,data_type是数据类型,PARTITIONED BY 是分区表,CLUSTERED BY是分桶表,STORED BYS是存储格式,LOCATION是存储位置。在PPT里还有关于表的各种操作。

  • 8
    点赞
  • 14
    收藏
    觉得还不错? 一键收藏
  • 4
    评论
评论 4
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值