CSDN话题挑战赛第2期
参赛话题:大数据学习成长记录
参考:利用Hadoop API使用Java开发程序学习-文件夹操作
前言/背景
提示:Hadoop学习时,通常大家使用的都是shell命令操作hdfs系统,但实际到程序开发时,通过Java开发程序对hdfs文件系统操作的需求会更多,更能增加程序的稳定性、提高运行效率,方便管理。因此学习利用Hadoop API接口,开发Java程序在hdfs上上传下载文件。
IDEA-community开发Java
掌握通过IDEA开发Java程序
1,创建新的Maven项目
根据提示完成项目创建。配置pom.xml文件
<?xml version="1.0" encoding="UTF-8"?> <project xmlns="http://maven.apache.org/POM/4.0.0" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation="http://maven.apache.org/POM/4.0.0 http://maven.apache.org/xsd/maven-4.0.0.xsd"> <modelVersion>4.0.0</modelVersion> <groupId>cn.com.lh</groupId> <artifactId>GUNBigdata</artifactId> <version>1.0-SNAPSHOT</version> <properties> <maven.compiler.source>8</maven.compiler.source> <maven.compiler.target>8</maven.compiler.target> </properties> <!-- 项目依赖 --> <dependencies> <dependency> <groupId>org.apache.hadoop</groupId> <artifactId>hadoop-common</artifactId> <version>2.7.3</version> </dependency> <dependency> <groupId>org.apache.hadoop</groupId> <artifactId>hadoop-hdfs</artifactId> <version>2.7.3</version> </dependency> <dependency> <groupId>junit</groupId> <artifactId>junit</artifactId> <version>4.12</version> </dependency> <dependency> <groupId>commons-logging</groupId> <artifactId>commons-logging</artifactId> <version>1.2</version> </dependency> </dependencies> <build> <plugins> <plugin> <groupId>org.apache.maven.plugins</groupId> <artifactId>maven-compiler-plugin</artifactId> <version>3.0</version> <configuration> <source>1.8</source> <target>1.8</target> <encoding>UTF-8</encoding> <!-- <verbal>true</verbal>--> </configuration> </plugin> <plugin> <groupId>org.apache.maven.plugins</groupId> <artifactId>maven-shade-plugin</artifactId> <version>2.4.3</version> <executions> <execution> <phase>package</phase> <goals> <goal>shade</goal> </goals> <configuration> <minimizeJar>true</minimizeJar> </configuration> </execution> </executions> </plugin> </plugins> </build> </project>
1,开发在hdfs上创建上传文件代码package hdfs; import org.apache.hadoop.conf.Configuration; import org.apache.hadoop.fs.FSDataOutputStream; import org.apache.hadoop.fs.FileSystem; import org.apache.hadoop.fs.Path; import org.apache.hadoop.io.IOUtils; import java.io.File; import java.io.FileInputStream; import java.io.IOException; import java.net.URI; import java.net.URISyntaxException; /** * @Classname bigdatahdfsupdate * @Description 上传文件 * @Date 2022/9/26 22:47 * @Created by Tiger_Li */ public class bigdatahdfsupdate { public static void main(String[] args) throws URISyntaxException, IOException, InterruptedException { // 1. 导入的configuration版本要与集群的一致 Configuration conf = new Configuration(); URI uri = new URI("hdfs://node1:9000"); // 2. 创建fs对象 FileSystem fs = FileSystem.get(uri, conf, "root"); // 3. 读取本地文件,利用FileInputStream读取本地文件 FileInputStream inputStream = new FileInputStream(new File("D:\\niit\\2022\\javademo1.txt")); // 4. 写入远程HDFS上,FSDataOutputStream将文件写入HDFS FSDataOutputStream out = fs.create(new Path("/Java/bigdata204/javademo1")); // 5. 执行写入操作 IOUtils.copyBytes(inputStream, out, conf); // 6. 关闭并打印提示 fs.close(); System.out.println("上传文件成功!"); } }
2,开发在hdfs上创建下载文件到windows的代码
package hdfs; import org.apache.hadoop.conf.Configuration; import org.apache.hadoop.fs.FSDataInputStream; import org.apache.hadoop.fs.FileSystem; import org.apache.hadoop.fs.Path; import org.apache.hadoop.io.IOUtils; import java.io.File; import java.io.FileOutputStream; import java.io.IOException; /** * @Classname bigdata204hdfsdownload * @Description 实现hdfs上的文件下载 * @Date 2022/9/28 9:10 * @Created by Tiger_Li */ public class bigdata204hdfsdownload { /** * 思路: * 1. 配置好HDFS路径,了解操作的集群 Configuration * 2. 明确本地存储路径和hdfs上的存储路径 * 3. 通过IOUtils实现文件下载 */ public static void main(String[] args) throws IOException { // 1. HDFS Configuration conf = new Configuration(); conf.set("fs.defaultFS","hdfs://node5:9000"); FileSystem fs = FileSystem.get(conf); // 2. 存储路径 // hdfs FSDataInputStream ips = fs.open(new Path("/Java/bigdata204/flume.log")); // local FileOutputStream out = new FileOutputStream(new File("D:\\niit\\2022\\flumedemo2.txt")); // 3. IOUtils实现下载 IOUtils.copyBytes(ips,out,conf); // 关闭filesystem fs.close(); System.out.println("下载成功"); } }
注意填写的hdfs namenode地址要是active状态,不能为standby状态的。
效果展示
hdfs上传文件
hdfs下载文件
个人经验总结
用Java开发IDEA时,导入依赖时,要注意hadoop版本与集群的hadoop版本一直,由于一直是多hadoop版本开发,idea中会有多个版本的导入提示,导入hadoop版本不一致,会引发各种问题,尤其需要注意。