简单随机抽样 :是过滤的一个常见应用,比如提取某字段最高记录,或者随机抽取几条。 抽样可以用来得到
更小的,更具有代表性的数据子集 。
很多机器学习算法在大数据集上运行不够高效,所以需要为提取较小的数据子集 创建新的模式。
当选取的比例是一个很小值的时候,你会在输出结果中发现大量的小文件,如果遇到这种情况
1
可以设置 reduce 数目为1, 并且不指定 reduce 类。 这就是要求 MapReduce 框架使用一个 identity reduce 简单的手机输出并写到一个文件中。