hive 的 left semi join 讲解

本文详细介绍了Hive中的LEFT SEMI JOIN操作,它等价于IN/EXISTS子查询,但更高效。内容包括LEFT SEMI JOIN的示例、特点,如只允许在ON子句设置过滤条件,且结果仅包含左表字段。通过对比与JOIN的区别,揭示了LEFT SEMI JOIN在处理重复记录时的性能优势。
摘要由CSDN通过智能技术生成

hive 的 left semi join 讲解
2018-04-10 18:14:07 HappyRocking 阅读数 13850更多
分类专栏: 大数据/hive
版权声明:本文为博主原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接和本声明。
本文链接:https://blog.csdn.net/HappyRocking/article/details/79885071
介绍

LEFT SEMI JOIN (左半连接)是 IN/EXISTS 子查询的一种更高效的实现。

Hive 当前没有实现 IN/EXISTS 子查询,所以可以用 LEFT SEMI JOIN 重写你的子查询语句。

示例
在这里插入图片描述

可以改写为

在这里插入图片描述

特点

1、left semi join 的限制是, JOIN 子句中右边的表只能在 ON 子句中设置过滤条件,在 WHERE 子句、SELECT 子句或其他地方过滤都不行。

2、left semi join 是只传递表的 join key 给 map 阶段,因此left semi join 中最后 select 的结果只许出现左表。

3、因为 left semi join 是 in(keySet) 的关系,遇到右表重复记录,左表会跳过,而 join 则会一直遍历。这就导致右表有重复值得情况下 left semi

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值