- 博客(1)
- 收藏
- 关注
原创 Spark数据倾斜的解决方案
Spark数据倾斜的解决方案 使用Hive ETL预处理数据 适用场景 导致数据倾斜的是Hive表。如果该Hive表中的数据本身很不均匀(比如某个key对应了100万数据,其他key才对应了10条数据),而且业务场景需要频繁使用Spark对Hive表执行某个分析操作,那么比较适合使用这种技术方案。 实现思路 此时可以评估一下,是否可以通过Hive来进行数据预处理(即通过Hive ETL预先对数据按照key进行聚合,或者是预先和其他表进行join),然后在Spark作业中针对的数据源就不是原来的Hive表了,
2021-07-05 20:09:46 130 2
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人