hive表进行left join的时候中文变成问号?

先上解决方案
中文变成问号?是因为原表信息为varchar,改成string就ok,直接select的话他的结果集也是临时用varchar模型存的,所以展示效果也是问号。
如果是insert overwrite table xxx select …这种形式,可以在select 语句中把原表涉及中文的字段利用cast关键字转成string
例如

insert overwrite table test
select 
a.id
b.name 
from 
(select id from a) a 
left join 
(select id,cast(name as string) from b) b
on a.id = b.id

原因
hive源码org.apache.hadoop.hive.ql.io.orc.RecordReaderImpl类中对每一列进行写入的

nextValue(ColumnVector vector, int row,TypeDescription schema,Object previous)

方法

	if (vector.isRepeating) {
		row = 0;
	}

	if (vector.noNulls || !vector.isNull[row]) {
		HiveCharWritable result;
	
	
		if(previous==null||previous.getClass()!=HiveCharWritable.class) {
			result = new HiveCharWritable();
		} else {
			result = (HiveCharWritable) previous;
		}
		
		BytesColumnVector bytes = (BytesColumnVector) vector;
	
		result.set(bytes.toString(row), size);
	
		return result;

	} else {

	return null;

	}

上面调用了BytesColumnVector 这个类的toString我们再点进去发现,是new的string并没有指定字符集

所以我上面提到使用string来作为列类型而非varchar,因为string在处理数据时默认使用utf-8进行编码

  • 1
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值