[hive] mr 引擎和spark引擎对reduce task的设置

最新推荐文章于 2023-10-17 11:27:28 发布

胖胖学编程

最新推荐文章于 2023-10-17 11:27:28 发布

阅读量2k

点赞数

分类专栏： hive 文章标签： hive

本文链接：https://blog.csdn.net/qq_35896718/article/details/123740318

版权

hive 专栏收录该内容

55 篇文章 2 订阅

订阅专栏

Configuration Properties - Apache Hive - Apache Software Foundation

1.mr

mapred.reduce.tasks
强制指定reduce个数
默认值：-1
添加于：Hive 0.1.0
通过将此属性设置为 -1，Hive 将自动计算出reduce task的数量。
 
hive.exec.reducers.bytes.per.reducer
每个reduce task处理的最大数据量
Hive 0.14.0 及更高版本中为256,000,000 即256 MB
也就是说，如果输入大小为 1 GB，则将使用 4 个 reducer。
 
hive.exec.reducers.max
每个job最大的reduce task个数
默认值：1009 在 Hive 0.14.0 及更高版本中
每个job 的最大reducer 数量。

2.spark

mapreduce.job.reduces
默认值：-1（禁用）
添加于：Hive 1.1.0 与 HIVE-7567
设置每个 Spark shuffle 阶段的 reduce 任务数。
默认情况下设置为 -1:reduce task的数量是根据 Hive 数据统计动态计算的。将此设置为一个常数值会为所有 Spark shuffle 阶段设置相同数量的分区。

胖胖学编程

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
[hive] mr 引擎和spark引擎对reduce task的设置

Configuration Properties - Apache Hive - Apache Software Foundation1.mrmapred.reduce.tasks强制指定reduce个数默认值：-1添加于：Hive 0.1.0通过将此属性设置为 -1，Hive 将自动计算出reduce task的数量。hive.exec.reducers.bytes.per.reducer每个reduce task处理的最大数据量Hive 0.14.0 及更高版本中为256,0.
复制链接

扫一扫