利用Spark Rdd生成Hfile直接导入到Hbase

最新推荐文章于 2023-12-05 10:19:30 发布

亮亮-AC米兰

最新推荐文章于 2023-12-05 10:19:30 发布

阅读量1.1w

点赞数 1

分类专栏： Spark 文章标签： spark

本文链接：https://blog.csdn.net/wl044090432/article/details/50821313

版权

本文介绍了如何利用Spark的RDD功能生成Hfile，然后通过Bulk Load快速批量导入数据到Hbase中，以此提高大批量插入的效率。通过Java版本的代码示例展示了具体操作流程，并提供了相关参考文章链接。

摘要由CSDN通过智能技术生成

针对大批量插入Hbase的场景，如果单条记录插入的时候效率比较低下，如果可以利用Rdd生成Hfile的话，然后利用Bulk Load导入Hfile的话，则会大大提升导入的速度，废话不说，直接上代码：

1.利用Create创建表blog：create 'blog' ,'article'

2.创建数据文件 blog.txt

3.上传文件至hdfs

备注：因为之前文件已经上传了

4.Java版本代码

import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.fs.Path;
import org.apache.hadoop.hbase.HBaseConfiguration;
import org.apache.hadoop.hbase.KeyValue;
import org.apache.hadoop.hbase.client.HTable;
import org.apache.hadoop.hbase.io.ImmutableBytesWritable;
import org.apache.hadoop.hbase.mapred.TableOutputFormat;
import org.apache.hadoop.hbase.mapreduce.HFileOutputFormat;
import org.apache.hadoop.hbase.m

最低0.47元/天解锁文章

亮亮-AC米兰

关注

1
点赞
踩
14

收藏

觉得还不错? 一键收藏
4
评论
利用Spark Rdd生成Hfile直接导入到Hbase

针对大批量插入Hbase的场景，如果单条记录插入的时候效率比较低下，如果可以利用Rdd生成Hfile的话，然后利用Bulk Load导入Hfile的话，则会大大提升导入的速度，废话不说，直接上代码：1.利用Create创建表blog：create 'blog' ,'article'2.创建数据文件 blog.txt 3.上传文件至hdfs备注：
复制链接

扫一扫

专栏目录