sqoop（三） --m参数详解

最新推荐文章于 2022-11-07 17:34:38 发布

weixin_42934205

最新推荐文章于 2022-11-07 17:34:38 发布

阅读量2k

点赞数

分类专栏： sqoop 大数据文章标签： sqoop

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_42934205/article/details/116698449

版权

大数据同时被 2 个专栏收录

8 篇文章 0 订阅

订阅专栏

4 篇文章 0 订阅

订阅专栏

sqoop（三） --m参数详解

Sqoop并行化是启多个map task实现的，-m(或–num-mappers)参数指定map task数，默认是四个。
当指定为1时，可以不用设置split-by参数，不指定num-mappers时，默认为4，当不指定或者num-mappers大于1时，需要指定split-by参数。
并行度不是设置的越大越好，map task的启动和销毁都会消耗资源，而且过多的数据库连接对数据库本身也会造成压力。在并行操作里，首先要解决输入数据是以什么方式负债均衡到多个map的，即怎么保证每个map处理的数据量大致相同且数据不重复。–split-by指定了split column，在执行并行操作时(多个map task)，Sqoop需要知道以什么列split数据，其思想是：

1、先查出split column的最小值和最大值

2、然后根据map task数对(max-min)之间的数据进行均匀的范围切分

注意：

Sqoop以理想化方式根据split column将数据切分成多个范围，如果split键的值不是均匀分布，每个任务分配的数据量可能相差很大、导致数据倾斜。

sqoop任务的耗时快慢和源端RDBMS服务器，表大小，列数量、网络带宽有较大关系，生产环境中，为了防止主库被Sqoop抽崩，一般从备库中抽取数据。
一般RDBMS的导出速度控制在60~80MB/s，每个 map 任务的处理速度5~10MB/s 估算，即 -m 参数一般设置4~8，表示启动 4~8 个map 任务并发抽取。

weixin_42934205

关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
打赏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

打赏作者

weixin_42934205 你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20

扫码支付：¥1

获取中

扫码支付

您的余额不足，请更换扫码支付或充值

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。