hadoop的分布式缓存DistributedCache

CHSN

已于 2022-04-18 17:14:32 修改

阅读量626

点赞数

分类专栏： hadoop 文章标签：学习

于 2022-04-18 17:13:31 首次发布

原文链接：https://www.cnblogs.com/loveling-0239/p/7884195.html

版权

hadoop 专栏收录该内容

6 篇文章

订阅专栏

本文详细介绍了Hadoop MapReduce中的分布式缓存机制，通过`job.addCacheFile()`等方法将文件添加到任务执行节点的缓存中，提升数据处理效率。示例代码展示了如何在Mapper的setup方法中读取缓存文件进行Map端Join操作，避免了Reduce阶段，提高了整体性能。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

分布式缓存就是：Hadoop为MapReduce框架提供的一种分布式缓存机制，它会将需要缓存的文件分发到各个执行任务的子节点的机器中，各个节点可以自行读取本地文件系统上的数据进行处理。

不同文件类型的添加方法：
job.addArchiveToClassPath(archive); // 缓存jar包到task运行节点的classpath中 
job.addFileToClassPath(file); // 缓存普通文件到task运行节点的classpath中 
job.addCacheArchive(uri); // 缓存压缩包文件到task运行节点的工作目录 
job.addCacheFile(uri) // 缓存普通文件到task运行节点的工作目录

例如：

package com.atguigu.mapreduce.mapjoin;

import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.fs.Path;
import org.apache.hadoop.io.NullWritable;
import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.Job;
import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;
import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;

import java.io.IOException;
import java.net.URI;
import java.net.URISyntaxException;

public class MapJoinDriver {

    public static void main(String[] args) throws IOException, URISyntaxException, ClassNotFoundException, InterruptedException {

        // 1 获取job信息
        Configuration conf = new Configuration();
        Job job = Job.getInstance(conf);

        ......

        // 加载缓存数据
        job.addCacheFile(new URI("file:///D:/input/tablecache/cache.txt"));
        // Map端Join的逻辑不需要Reduce阶段，设置reduceTask数量为0
        job.setNumReduceTasks(0);

        // 6 设置输入输出路径
        FileInputFormat.setInputPaths(job, new Path("D:\\input"));
        FileOutputFormat.setOutputPath(job, new Path("D:\\output"));
        // 7 提交
        boolean b = job.waitForCompletion(true);
        System.exit(b ? 0 : 1);
    }
}

在Mapper类的setup方法中读取分布式缓存文件：Mapper类主要有4个方法：setup(),map(),cleanup(),run(),run()方法调用其它三个方法，顺序是：setup()-map()-cleanup。并且setup()执行且仅执行一次，主要用来为map()方法做一些准备工作，所以很多初始化的工作尽量放在这里做。Reducer类也是类似的。如下setup()：

public class MapJoinMapper extends Mapper<LongWritable, Text, Text, NullWritable> {

    private Map<String, String> pdMap = new HashMap<>();
    private Text text = new Text();

    //任务开始前将pd数据缓存进pdMap
    @Override
    protected void setup(Context context) throws IOException, InterruptedException {

        //通过缓存文件得到小表数据cache.txt
        URI[] cacheFiles = context.getCacheFiles();
        Path path = new Path(cacheFiles[0]);

        //获取文件系统对象,并开流
        FileSystem fs = FileSystem.get(context.getConfiguration());
        FSDataInputStream fis = fs.open(path);

        //通过包装流转换为reader,方便按行读取
        BufferedReader reader = new BufferedReader(new InputStreamReader(fis, "UTF-8"));

        //逐行读取，按行处理
        String line;
        while (StringUtils.isNotEmpty(line = reader.readLine())) {
            //切割一行    
            String[] split = line.split("\t");
            pdMap.put(split[0], split[1]);
        }

        //关流
        IOUtils.closeStream(reader);
    }

参考：https://www.cnblogs.com/loveling-0239/p/7884195.html