hive分桶

最新推荐文章于 2024-05-05 04:32:31 发布

CarlosXu14

最新推荐文章于 2024-05-05 04:32:31 发布

阅读量184

点赞数

分类专栏： hive

本文链接：https://blog.csdn.net/qq_43459184/article/details/101172275

版权

hive 专栏收录该内容

6 篇文章 0 订阅

订阅专栏

hive 分桶

分桶表是对列值取哈希值的方式，将不同数据放到不同文件中存储。
对于hive中每一个表、分区都可以进一步进行分桶。
由列的哈希值除以桶的个数来决定每条数据划分在哪个桶中。
适用场景：
数据抽样（ sampling ）

开启支持分桶
set hive.enforce.bucketing=true;
默认：false；设置为true之后，mr运行时会根据bucket的个数自动分配reduce task个数。（用户也可以通过mapred.reduce.tasks自己设置reduce任务个数，但分桶时不推荐使用）
注意：一次作业产生的桶（文件数量）和reduce task个数一致。

往分桶表中加载数据

insert into table bucket_table select columns from tbl;
insert overwrite table bucket_table select columns from tbl;

分桶表抽样查询

select * from bucket_table tablesample(bucket 1 out of 4 on columns);

TABLESAMPLE语法：
TABLESAMPLE(BUCKET x OUT OF y)
x：表示从哪个bucket开始抽取数据
y：必须为该表总bucket数的倍数或因子

例：
当表总bucket数为32时
TABLESAMPLE(BUCKET 2 OUT OF 16)，抽取哪些数据？
共抽取2（32/16）个bucket的数据，抽取第2、第18（16+2）个bucket的数据
TABLESAMPLE(BUCKET 2 OUT OF 256)，抽取哪些数据？
32/256=1/8的数据，分别在2，10，18….中

案列：
测试数据：

1,tom,11
2,cat,22
3,dog,33
4,hive,44
5,hbase,55
6,mr,66
7,alice,77
8,scala,88

创建数据表，将数据加载到表中：

CREATE TABLE psn31( id INT, name STRING, age INT)
ROW FORMAT DELIMITED FIELDS TERMINATED BY ',';

创建分桶表

CREATE TABLE psnbucket( id INT, name STRING, age INT)
CLUSTERED BY (age) INTO 4 BUCKETS 
ROW FORMAT DELIMITED FIELDS TERMINATED BY ',';

加载数据：

insert into table psnbucket select id, name, age from psn31;

抽样

select id, name, age from psnbucket tablesample(bucket 2 out of 4 on age);

CarlosXu14

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
hive分桶

hive 分桶分桶表是对列值取哈希值的方式，将不同数据放到不同文件中存储。对于hive中每一个表、分区都可以进一步进行分桶。由列的哈希值除以桶的个数来决定每条数据划分在哪个桶中。适用场景：数据抽样（ sampling ）开启支持分桶set hive.enforce.bucketing=true;默认：false；设置为true之后，mr运行时会根据bucket的个数自动分配redu...
复制链接

扫一扫

专栏目录