Hive 的 TRANSFORM 自定义函数

Hive 的 TRANSFORM 关键字提供了在 SQL 中调用自写脚本的功能。适合实现 Hive 中没有的 功能 又不想写 UDF 的情况,脚本一般都是python写的。


Json 数据: {"movie":"1193","rate":"5","timeStamp":"978300760","uid":"1"} 
需求:把json的字段timeStamp转换为日期编号。 

1、先加载 rating.json 文件到 hive 的一个原始表
 rate_json create table rate_json(line string) row format delimited; 
 load data local inpath '/home/j.json' into table rate_json; 

2、创建 rate 这张表用来存储解析 json 出来的字段: 

create table rate(movie int, rate int, unixtime int, userid int) row format delimited fields terminated by '\t'; 

解析 json,得到结果之后存入 rate 表: 

insert into table rate 
select get_json_object(line,'$.movie') as movie, 
get_json_object(line,'$.rate') as rate, 
get_json_object(line,'$.timeStamp') as unixtime, 
get_json_object(line,'$.uid') as userid 
from rate_json; 

使用 transform+python 的方式去转换 unixtime 为 weekday 

先编辑一个 python 脚本文件 

import sys 
import datetime for line in sys.stdin: 
#获取每一行的内容并去掉头尾的空格 
line = line.strip() 
#根据换行符截取对应的字段 
movie,rate,timeinfo,userid = line.split('\t') 
#将timeinfo转成时间格式 
weekday = datetime.datetime.fromtimestamp(float(timeinfo)).isoweekday() 
#重新拼接拼接新的内容并加入换行符 
print '\t'.join([movie, rate, str(weekday),userid]) 

3,创建最后的用来存储调用 python 脚本解析出来的数据的表:lastjsontable
create table lastjsontable(movie int, rate int, weekday int, userid int) row format delimited fields terminated by '\t'; 

保存文件 然后,将文件加入 hive 的 classpath: 
hive>add file /home/datechange.py; 
hive> insert into table lastjsontable select transform(movie,rate,unixtime,userid) using 'python datechange.py' as(movie,rate,weekday,userid) from rate; 

4,最后查询看数据是否正确 
select distinct(weekday) from lastjsontable;
  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值