Hbase 行键设计（rowkey）实现多条件查询

最新推荐文章于 2024-07-28 23:55:21 发布

iblks

最新推荐文章于 2024-07-28 23:55:21 发布

阅读量5.1w

点赞数 8

分类专栏： hbase 文章标签：行键 rowkey 范围多列查询

本文链接：https://blog.csdn.net/alphags/article/details/53786777

版权

本文介绍了如何通过优化Hbase行键（rowkey）设计以实现多条件查询，主要方法是将查询列的值转换为整型存储，并使用自定义的相等和范围比较器，结合Hbase过滤器，实现类似SQL的查询功能。文章探讨了行键设计的原则，提出了将不同数据类型的数据整合到rowkey中的方法，并提供了算法实现和测试情况。

摘要由CSDN通过智能技术生成

2018最新编辑

本文写完的时间是2017年初写的，当时对HBASE的理解不深，随着一年多的学习，感觉这篇文章里的方法挺鸡肋的，在我近一年的工作中根本没有用到。
HBASE的使用跟业务逻辑有很强的关联性，就像本文里提到的例子使用ElasticSearch更合适。HBASE适合那种使用key-value模式的快速查询，多字段查询还是不适合它。
所以大家如果看本文的话，就全当是加深对hbase过滤器的理解吧，内容概括起来就是实现一个使用位运算的比较器。

摘要

本文主要内容是通过合理hbase 行键（rowkey)设计实现快速的多条件查询，所采用的方法将所有要用于查询中的列经过一些处理后存储在rowkey中，查询时通过rowkey进行查询，提高rowkey的利用率，加快查询速度。行键（rowkey)并不是简单的把所有要查询的列的值直接拼接起来，而是将各个列的数据转成整型（int)数据来存储。之后实现两个自定义的比较器（comparator)：一个是相等比较器，用于实现类似于SQL的多条件精确查找功能。
select * from table where col1='a' and col2='b'

另一个是范围比较器，用于实现类似于SQL语句
select * from table where col3 > '10' and col4<'100'
这样的范围查找功能。
当两个比较器配合使用再结合hbase的过滤器，以实现类似于下面这条SQL语句这样多条件的查询
select * from table where col1='a' and col2='b' andcol3 > '10' and col4<'100'
文章源码位于https://github.com/alphg/hbase.rowkeycomparator

问题背景

hbase 作为开源列式存储，使用起来与传统的关系型数据库还是有很多不同的。就以我所在公司为例，下面的数据是一些网页连通性的数据，

{ "_id" : { "$oid" : "584a6e030cf29ba18da2fcd5"} , "url" : "http://www.nmlc.gov.cn/zsyz.htm" , "md5url" : "ea67a96f233d6fcfd7cabc9a6a389283" , "status" : -1 , "code" : 404 , "stime" : 1481272834722 , "sdate" : 20161209 , "sitecode" : "1509250008" , "ip" : "10.168.106.153" , "port" : 5200 , "type" : 2 , "intime" : { "$date" : 1481272835222} , "free" : 0 , "close" : 0 , "queue" : 1 , "scantype" : 1 , "scanmemo" : ""}
{ "_id" : { "$oid" : "584a6e020cf224463e76c162"} , "url" : "http://www.xzxzzx.gov.cn:8000/wbsprj/indexlogin.do" , "md5url" : "fd38c0fb8f6e839be56b67c69ad2baa5" , "status" : -1 , "code" : 503 , "stime" : 1481272828174 , "sdate" : 20161209 , "sitecode" : "3203000002" , "ip" : "10.117.8.89" , "port" : 5200 , "type" : 2 , "intime" : { "$date" : 1481272834887} , "free" : 0 , "close" : 0 , "queue" : 1 , "scantype" : 0 , "scanmemo" : ""}
{ "_id" : { "$oid" : "584a6e020cf27d1a31f617e0"} , "url" : "http://www.nmds.gov.cn/portal/bsfw/nsfd/list_1.shtml" , "md5url" : "d51abcd8edff79d23ca4a9a0576a1