利用Hadoop API使用Java开发程序学习-HDFS上传下载文件

最新推荐文章于 2023-05-08 14:31:59 发布

pblh123

最新推荐文章于 2023-05-08 14:31:59 发布

阅读量1.2k

点赞数 3

分类专栏： Hadoop Java 文章标签： hadoop java 学习

本文链接：https://blog.csdn.net/pblh123/article/details/127073094

版权

Hadoop 同时被 2 个专栏收录

15 篇文章 4 订阅

订阅专栏

Java

4 篇文章 2 订阅

订阅专栏

CSDN话题挑战赛第2期
参赛话题：大数据学习成长记录

参考：利用Hadoop API使用Java开发程序学习-文件夹操作

前言/背景

提示：Hadoop学习时，通常大家使用的都是shell命令操作hdfs系统，但实际到程序开发时，通过Java开发程序对hdfs文件系统操作的需求会更多，更能增加程序的稳定性、提高运行效率，方便管理。因此学习利用Hadoop API接口，开发Java程序在hdfs上上传下载文件。

IDEA-community开发Java

掌握通过IDEA开发Java程序

1，创建新的Maven项目
主流关系型数据库Oracle、MySQL、PG、SQLserver等，非关系型数据库Redis,MongoDB等部署、数据类型,SQL学习，故障案例处理，高可用的学习技能分享。
根据提示完成项目创建。

配置pom.xml文件

<?xml version="1.0" encoding="UTF-8"?>
<project xmlns="http://maven.apache.org/POM/4.0.0"
         xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
         xsi:schemaLocation="http://maven.apache.org/POM/4.0.0 http://maven.apache.org/xsd/maven-4.0.0.xsd">
    <modelVersion>4.0.0</modelVersion>

    <groupId>cn.com.lh</groupId>
    <artifactId>GUNBigdata</artifactId>
    <version>1.0-SNAPSHOT</version>

    <properties>
        <maven.compiler.source>8</maven.compiler.source>
        <maven.compiler.target>8</maven.compiler.target>
    </properties>

    <!-- 项目依赖 -->
    <dependencies>

        <dependency>
            <groupId>org.apache.hadoop</groupId>
            <artifactId>hadoop-common</artifactId>
            <version>2.7.3</version>
        </dependency>
        <dependency>
            <groupId>org.apache.hadoop</groupId>
            <artifactId>hadoop-hdfs</artifactId>
            <version>2.7.3</version>
        </dependency>
        <dependency>
            <groupId>junit</groupId>
            <artifactId>junit</artifactId>
            <version>4.12</version>
        </dependency>

        <dependency>
            <groupId>commons-logging</groupId>
            <artifactId>commons-logging</artifactId>
            <version>1.2</version>
        </dependency>

    </dependencies>


    <build>
        <plugins>
            <plugin>
                <groupId>org.apache.maven.plugins</groupId>
                <artifactId>maven-compiler-plugin</artifactId>
                <version>3.0</version>
                <configuration>
                    <source>1.8</source>
                    <target>1.8</target>
                    <encoding>UTF-8</encoding>
                    <!--    <verbal>true</verbal>-->
                </configuration>
            </plugin>

            <plugin>
                <groupId>org.apache.maven.plugins</groupId>
                <artifactId>maven-shade-plugin</artifactId>
                <version>2.4.3</version>
                <executions>
                    <execution>
                        <phase>package</phase>
                        <goals>
                            <goal>shade</goal>
                        </goals>
                        <configuration>
                            <minimizeJar>true</minimizeJar>
                        </configuration>
                    </execution>
                </executions>
            </plugin>
        </plugins>
    </build>
</project>

1，开发在hdfs上创建上传文件代码

package hdfs;

import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.fs.FSDataOutputStream;
import org.apache.hadoop.fs.FileSystem;
import org.apache.hadoop.fs.Path;
import org.apache.hadoop.io.IOUtils;

import java.io.File;
import java.io.FileInputStream;
import java.io.IOException;
import java.net.URI;
import java.net.URISyntaxException;

/**
 * @Classname bigdatahdfsupdate
 * @Description 上传文件
 * @Date 2022/9/26 22:47
 * @Created by Tiger_Li
 */
public class bigdatahdfsupdate {

    public static void main(String[] args) throws URISyntaxException, IOException, InterruptedException {
//        1. 导入的configuration版本要与集群的一致
        Configuration conf = new Configuration();
        URI uri = new URI("hdfs://node1:9000");
//        2. 创建fs对象
        FileSystem fs = FileSystem.get(uri, conf, "root");
//        3. 读取本地文件，利用FileInputStream读取本地文件
        FileInputStream inputStream = new FileInputStream(new File("D:\\niit\\2022\\javademo1.txt"));
//        4. 写入远程HDFS上，FSDataOutputStream将文件写入HDFS
        FSDataOutputStream out = fs.create(new Path("/Java/bigdata204/javademo1"));
//        5. 执行写入操作
        IOUtils.copyBytes(inputStream, out, conf);
//        6. 关闭并打印提示
        fs.close();
        System.out.println("上传文件成功！");
    }

}

2，开发在hdfs上创建下载文件到windows的代码

package hdfs;

import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.fs.FSDataInputStream;
import org.apache.hadoop.fs.FileSystem;
import org.apache.hadoop.fs.Path;
import org.apache.hadoop.io.IOUtils;

import java.io.File;
import java.io.FileOutputStream;
import java.io.IOException;

/**
 * @Classname bigdata204hdfsdownload
 * @Description 实现hdfs上的文件下载
 * @Date 2022/9/28 9:10
 * @Created by Tiger_Li
 */
public class bigdata204hdfsdownload {

    /**
     * 思路：
     * 1. 配置好HDFS路径，了解操作的集群 Configuration
     * 2. 明确本地存储路径和hdfs上的存储路径
     * 3. 通过IOUtils实现文件下载
     */

    public static void main(String[] args) throws IOException {

//        1. HDFS
        Configuration conf = new Configuration();
        conf.set("fs.defaultFS","hdfs://node5:9000");
        FileSystem fs = FileSystem.get(conf);

//        2. 存储路径
//        hdfs
        FSDataInputStream ips = fs.open(new Path("/Java/bigdata204/flume.log"));
//        local
        FileOutputStream out = new FileOutputStream(new File("D:\\niit\\2022\\flumedemo2.txt"));
//        3. IOUtils实现下载
        IOUtils.copyBytes(ips,out,conf);

//        关闭filesystem
        fs.close();
        System.out.println("下载成功");
    }

}

注意填写的hdfs namenode地址要是active状态，不能为standby状态的。