Hive 的 TRANSFORM 关键字提供了在 SQL 中调用自写脚本的功能。适合实现 Hive 中没有的 功能又不想写 UDF 的情况,脚本一般都是python写的。
Json 数据: {"movie":"1193","rate":"5","timeStamp":"978300760","uid":"1"}
需求:把json的字段timeStamp转换为日期编号。
1、先加载 rating.json 文件到 hive 的一个原始表 rate_json
create table rate_json(line string) row format delimited;
load data local inpath'/home/j.json' into table rate_json;
2、创建 rate 这张表用来存储解析 json 出来的字段:
create table rate(movie int, rate int, unixtime int, userid int) row format delimited fields
terminated by'\t';
解析 json,得到结果之后存入 rate 表:
insert into table rate selectget_json_object(line,'$.movie') asmovie,
get_json_object(line,'$.rate') asrate,
get_json_object(line,'$.timeStamp') asunixtime,
get_json_object(line,'$.uid') asuseridfrom rate_json;
使用 transform+python 的方式去转换 unixtime 为 weekday
先编辑一个 python 脚本文件
1 import sys2 import datetime3 for line insys.stdin:4 #获取每一行的内容并去掉头尾的空格5 line =line.strip()6 #根据换行符截取对应的字段7 movie,rate,timeinfo,userid = line.split('\t')8 #将timeinfo转成时间格式9 weekday = datetime.datetime.fromtimestamp(float(timeinfo)).isoweekday()10 #重新拼接拼接新的内容并加入换行符11 print '\t'.join([movie, rate, str(weekday),userid])
3,创建最后的用来存储调用 python 脚本解析出来的数据的表:lastjsontable
create table lastjsontable(movie int, rate int, weekday int, userid int) row format delimited
fields terminated by'\t';
保存文件 然后,将文件加入 hive 的 classpath:
hive>add file /home/datechange.py;
hive> insert into table lastjsontable selecttransform(movie,rate,unixtime,userid)using 'python datechange.py' as(movie,rate,weekday,userid) from rate;
4,最后查询看数据是否正确
select distinct(weekday) from lastjsontable;