Greenplum 分布键 distribute hash分布和随机分布

  Greenplum是分布式系统,创建表时需要指定分布键,目的是为了数据能够平均分布到各个段,所以选择分布键十分重要,选择错了会导致数据不一致。
分布方式:
  • Hash分布:按分布键对数据列进行hash取模存放到对应的segment。
  • 随机分布:数据随机分布在数据库,每次查询都会查询所有的segment。
 

1.分布策略

(1)hash分布

  Greenplum默认使用hash分布策略。该策略可选一个或者多个列作为分布键(distribution key,简称DK)。分布键做哈希算法来确认数据存放到对应的segment上。相同分布键值会hash到相同的段上。表上最好有唯一键或者主键,这样能保证数据均衡分不到各个段上。
  如果没有主键或者唯一键,默认选择第一列作为分布键
语法:
CREATE TABLE TEST(
id INT,
num INT,
data INT
)
distribute by id;
 

(2)随机分布

  数据被随机分布到段上,相同记录可能会存放在不同的段上。随机分布可以保证数据平均,但是Greenplum的没有跨节点的唯一键约束数据,所以无法保证数据唯一。基于唯一性和性能考虑,推荐使用hash分布。
语法:
CREATE TABLE TEST(
id INT,
num INT,
data INT
)
distribute by random;
 

2.分布键语法

(1)查看表的节点分布情况
select gp_segment_id,count(1) from 表名 group by 1 order by 1;
 
(2)更改分布键
# 如果有主键存在,需要先删除主键关联
ALTER TABLE 表名 set distributed by(列名);
 
  • 1
    点赞
  • 14
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值