bulk load关于分隔符的问题

最新推荐文章于 2023-08-02 20:00:00 发布

chuteng3602

最新推荐文章于 2023-08-02 20:00:00 发布

阅读量565

点赞数

文章标签： java 大数据

原文链接：https://my.oschina.net/u/580135/blog/612173

版权

在使用HBase的Bulk Load导入数据时，若数据以制表符(' ')分隔，不建议指定-Dimporttsv.separator参数，因为默认分隔符就是制表符。若指定该参数且值仍为' '，会导致TsvParser抛出异常，提示只支持单字节分隔符。

摘要由CSDN通过智能技术生成

在查看bulk load的源码了解到，其默认的分隔符为\t，也就是说如果数据是tab键分割的，就不需要指定分隔符了，如果需要换成其它分割符，在执行时加上-Dimporttsv.separator=","，则变成了以","分割。

前两天，无意间使用bulk load导入数据，导入的数据是以“\t”分割的，我在命令中指定了-Dimporttsv.separator="\t"，怪事就出现了，报出异常：

java.lang.IllegalArgumentException: TsvParser only supports single-byte separators
        at com.google.common.base.Preconditions.checkArgument(Preconditions.java:88)
        at org.apache.hadoop.hbase.mapreduce.ImportTsv$TsvParser.<init>(ImportTsv.java:88)
        at org.apache.hadoop.hbase.mapreduce.ImportTsv$TsvImporter.setup(ImportTsv.java:218)
        at org.apache.hadoop.mapreduce.Mapper.run(Mapper.java:142)
        at org.apache.hadoop.mapred.MapTask.runNewMapper(MapTask.java:621)
        at org.apache.hadoop.mapred.MapTask.run(MapTask.java:305)
        at