报错信息 :
Error while compiling statement: FAILED: SemanticException [Error 10249]:
Line 2:6 Unsupported SubQuery Expression 'id': Correlating expression cannot contain unqualified column references.
报错sql :
select
id,name
from test_stu
where id in (select id from test_score);
报错原因 :
hive 1.1版本支持in,但是不支持in的子查询。
解决方法 :
使用 LEFT SEMI JOIN 改写sql。
LEFT SEMI JOIN (左半连接)是 IN/EXISTS 子查询的一种更高效的实现。
Hive 当前没有实现 IN/EXISTS 子查询,所以可以用 LEFT SEMI JOIN 重写你的子查询语句。
将上面的sql改写为 :
select
id,name
from test_stu a
LEFT SEMI JOIN
test_score b
on a.id = b.id;
LEFT SEMI JOIN 特点 :
- 1、left semi join 的限制是, JOIN 子句中右边的表只能在 ON 子句中设置过滤条件,在 WHERE 子句、SELECT 子句或其他地方过滤都不行。
- 2、left semi join 是只传递表的 join key 给 map 阶段,因此left semi join 中最后 select 的结果只许出现左表。
- 3、因为 left semi join 是 in(keySet) 的关系,遇到右表重复记录,左表会跳过,而 join 则会一直遍历。这就导致右表有重复值得情况下 left semi join 只产生一条,join 会产生多条,也会导致 left semi join 的性能更高。
- 4、explain查看执行计划,和join 操作一样,会对关联key为null的数据进行过滤操作,left join 不会对 key 为null 的数据进行过滤操作。
比如以下A表和B表进行 join 或 left semi join,然后 select 出所有字段,结果区别如下:
注意:蓝色叉的那一列实际是不存在left semi join中的,因为最后 select 的结果只许出现左表。