1. 问题描述
DataX将MySQL数据同步到HDFS中时,空值(NULL)存到HDFS中时,默认是存储为空字符串(‘’)。
2. 原因分析
HFDS Writer并未提供nullFormat参数:也就是用户并不能自定义null值写到HFDS文件中的存储格式。默认情况下,HFDS Writer会将null值存储为空字符串(‘’),而Hive默认的null值存储格式为\N。所以后期将DataX同步的文件导入Hive表就会出现问题。
3. 解决方案
处理方案有2个:
1. 修改源码。修改DataX HDFS Writer的源码,增加自定义null值存储格式的逻辑,将空字符串存储为\N,这样hive在建表时就不用指定格式了。

以上已orc文件写入为例,同理可以应用到textfile格式的处理。

以上左边你可以对其写死,所有的NULL均转为\\N ,或者像我这边传进来nullFormat使得NULL作为空还是空字符串取决于你这边设置值。
可参考记Datax3.0解决MySQL抽数到HDFSNULL变为空字符的问题_datax nullformat_谭正强的博客-CSDN博客
2. 在Hive中建表时指定null值存储格式为空字符串(''),添加: NULL DEFINED AS ‘’
例如:
DROP TABLE IF EXISTS base_province;
CREATE EXTERNAL TABLE base_province
(
`id` STRING COMMENT '编号',
`name` STRING COMMENT '省份名称',
`region_id` STRING COMMENT '地区ID',
`area_code` STRING COMMENT '地区编码',
`iso_code` STRING COMMENT '旧版ISO-3166-2编码,供可视化使用',
`iso_3166_2` STRING COMMENT '新版IOS-3166-2编码,供可视化使用'
) COMMENT '省份表'
ROW FORMAT DELIMITED FIELDS TERMINATED BY '\t'
NULL DEFINED AS ''
LOCATION '/base_province/';
4. 运行结果

5. 参考文章
当使用DataX将MySQL数据同步到HDFS时,遇到NULL值会被默认存储为空字符串。文章提出了两种解决方案:一是修改DataXHDFSWriter源码,增加null值格式化为N的逻辑;二是Hive建表时指定NULL值为空字符串。这两种方法能解决Hive导入数据时的兼容性问题。
1129

被折叠的 条评论
为什么被折叠?



