大数据学习之路之HBASE

最新推荐文章于 2023-11-16 21:29:14 发布

scuwangjun

最新推荐文章于 2023-11-16 21:29:14 发布

阅读量849

点赞数

分类专栏： web中间件

本文链接：https://blog.csdn.net/u014672511/article/details/101033712

版权

Hadoop之HBASE

一、HBASE简介

HBase是一个开源的、分布式的，多版本的，面向列的，半结构化的NoSql数据库，提供高性能的随机读写结构化数据的能力。它可以直接使用本地文件系统，也可以使用Hadoop的HDFS文件存储系统。不过，为了提高数据的可靠性和系统的健壮性，并且发挥HBase处理大数据的能力，使用HDFS作为文件存储系统才更为稳妥。

HBase存储的数据从逻辑上来看就像一张很大的表，并且它的数据列可以根据需要动态地增加。除此之外，每个单元（cell，由行和列所确定的位置）中的数据又可以具有多个版本（通过时间戳来区别）。从下图可以看出，HBase还具有这样的特点：它向下提供了存储，向上提供了运算。另外，在HBase之上还可以使用Hadoop的MapReduce计算模型来并行处理大规模数据，这也是它具有强大性能的核心所在。它将数据存储与并行计算完美地结合在一起。

[外链图片转存失败(img-FvCYiZLe-1568893204596)(../../assets/HBASE关系图.png)]

HBase 和 HDFS

HDFS	HBase
HDFS是适于存储大容量文件的分布式文件系统。	HBase是建立在HDFS之上的数据库。
HDFS不支持快速单独记录查找。	HBase提供在较大的表快速查找。
它提供了高延迟批量处理;没有批处理概念。	它提供了数十亿条记录低延迟访问单个行记录（随机存取）。
它提供的数据只能顺序访问。	HBase内部使用哈希表和提供随机接入，并且其存储索引，可将在HDFS文件中的数据进行快速查找。

二、HBASE表结构

HBASE表具有以下特点：

大：一个表可以有上亿行，上百万列
面向列：面向列(族)的存储和权限控制，列(族)独立检索。
稀疏：对于为空(null)的列，并不占用存储空间，因此，表可以设计的非常稀疏。

HBase以表的形式存储数据。表有行和列组成。列划分为若干个列族(row family)。下面是HBASE表的逻辑视图：

[外链图片转存失败(img-24JpFy6B-1568893204597)(../../assets/HBASE数据结构.png)]

在shell客户端展示：

> scan 'member'
ROW                                               COLUMN+CELL                                       lisi                 column=address:, timestamp=1567757931802, value=sichuan                       lisi                 column=info:, timestamp=1567757982455, value=info2 
lisi                 column=info:love, timestamp=1567758039091, value=movie                         lisi                 column=school:, timestamp=1567758005941, value=xinhua                         zhangsan             column=address:city, timestamp=1567755403595, value=beijing                   zhangsan             column=info:, timestamp=1567755827530, value=info1                             zhangsan             column=info:age, timestamp=1567756662127, value=26 
zhangsan             column=info:birthday, timestamp=1567755398376, value=1993-11-20               zhangsan             column=info:country, timestamp=1567755402535, value=china                     zhangsan             column=school:, timestamp=1567757294341, value=shiyan                         2 row(s)
Took 0.0945 seconds

下面依次介绍这些结构：

Row key：用来检索记录的主键，类似key-value结构的key。访问hbase table的行，只有三种方式：
- 通过单个row key访问；
- 通过row key的range；
- 全表扫描；
列族：hbase表中的每个列，都属于某个列族，列族属于表结构（必须在使用表之前定义），列不属于（插入数据的时候可以随时添加列），比如上面的info，address，school这些属于列族，info:age，info:love这些属于列。
Cell：row key和列以及时间戳唯一确定的单元，用来存储真实的数据，cell中的数据没有类型，全部是字节码形式存储。
时间戳：每个cell中保存着同一份数据的多个版本，版本通过时间戳来索引。为了避免数据存在过多版本造成的的管理 (包括存贮和索引)负担，hbase提供了两种数据版本回收方式。一是保存数据的最后n个版本，二是保存最近一段时间内的版本（比如最近七天）。用户可以针对每个列族进行设置。

三、安装运行HBASE

wget http://apache.01link.hk/hbase/2.2.0/hbase-2.2.0-bin.tar.gz 
tar -zxvf hbase-2.2.0-bin.tar.gz 
cd hbase-2.2.0
vim conf/hbase-site.xml
＜configuration＞
	<property>
		<name>hbase.rootdir</name>
		<value>file:///tmp/hbase-${user.name}/hbase</value>
	</property>
＜/configuration＞
# 单机模式运行，使用的是本次文件存储。不依赖Hadoop
./bin/start-hbase.sh
# 查看进程
jps
9758 HMaster
# 启动成功后可以在 http://localhost:16010 访问hbase的web页面
# 停止Hbase服务
./bin/stop-hbase.sh

# 进入HBASE shell
./bin/hbase shell
HBase Shell
Use "help" to get list of supported commands.
Use "exit" to quit this interactive shell.
For Reference, please visit: http://hbase.apache.org/2.0/book.html#shell
Version 2.2.0, rUnknown, Tue Jun 11 04:30:30 UTC 2019
Took 0.0128 seconds                                                                                                                                                                              
hbase(main):001:0>

四、shell DDL操作

# 建表
> create 'member','member_id','address',

最低0.47元/天解锁文章

scuwangjun

关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
大数据学习之路之HBASE

Hadoop之HBASE一、HBASE简介HBase是一个开源的、分布式的，多版本的，面向列的，半结构化的NoSql数据库，提供高性能的随机读写结构化数据的能力。它可以直接使用本地文件系统，也可以使用Hadoop的HDFS文件存储系统。不过，为了提高数据的可靠性和系统的健壮性，并且发挥HBase处理大数据的能力，使用HDFS作为文件存储系统才更为稳妥。HBase存储的数据从逻辑上来看就像一张...
复制链接

扫一扫