Hive的Transform的实现

最新推荐文章于 2024-07-24 21:14:44 发布

anita9999

最新推荐文章于 2024-07-24 21:14:44 发布

阅读量300

点赞数

分类专栏：大数据文章标签： hive

原文链接：https://www.cnblogs.com/songweideboke/p/9814604.html

版权

大数据专栏收录该内容

4 篇文章 0 订阅

订阅专栏

Hive 的 TRANSFORM 关键字提供了在 SQL 中调用自写脚本的功能。适合实现 Hive 中没有的功能又不想写 UDF 的情况，脚本一般都是python写的。

Json 数据： {"movie":"1193","rate":"5","timeStamp":"978300760","uid":"1"}

需求：把json的字段timeStamp转换为日期编号。

1、先加载 rating.json 文件到 hive 的一个原始表 rate_json

create table rate_json(line string) row format delimited;
load data local inpath '/home/j.json' into table rate_json;

2、创建 rate 这张表用来存储解析 json 出来的字段：

create table rate(movie int, rate int, unixtime int, userid int) row format delimited fields
terminated by '\t';

　　解析 json，得到结果之后存入 rate 表：　

insert into table rate select 
get_json_object(line,'$.movie') as movie,
get_json_object(line,'$.rate') as rate,
get_json_object(line,'$.timeStamp') as unixtime,
get_json_object(line,'$.uid') as userid
from rate_json;

　　使用 transform+python 的方式去转换 unixtime 为 weekday

　　先编辑一个 python 脚本文件

 1 import sys
 2 import datetime
 3 for line in sys.stdin:
 4     #获取每一行的内容并去掉头尾的空格
 5     line = line.strip()
 6     #根据换行符截取对应的字段
 7     movie,rate,timeinfo,userid = line.split('\t')
 8     #将timeinfo转成时间格式
 9     weekday = datetime.datetime.fromtimestamp(float(timeinfo)).isoweekday()
10     #重新拼接拼接新的内容并加入换行符
11     print '\t'.join([movie, rate, str(weekday),userid])

3，创建最后的用来存储调用 python 脚本解析出来的数据的表：lastjsontable

create table lastjsontable(movie int, rate int, weekday int, userid int) row format delimited
fields terminated by '\t';

　　保存文件然后，将文件加入 hive 的 classpath：

hive>add file /home/datechange.py;
hive> insert into table lastjsontable select transform(movie,rate,unixtime,userid)
using 'python datechange.py' as(movie,rate,weekday,userid) from rate;

4，最后查询看数据是否正确

select distinct(weekday) from lastjsontable;

anita9999

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
Hive的Transform的实现

Hive 的 TRANSFORM 关键字提供了在 SQL 中调用自写脚本的功能。适合实现 Hive 中没有的功能又不想写 UDF 的情况，脚本一般都是python写的。Json 数据： {"movie":"1193","rate":"5","timeStamp":"978300760","uid":"1"}需求：把json的字段timeStamp转换为日期编号。1、先加载 rating.json 文件到 hive 的一个原始表 rate_jsoncreate table rate_jso
复制链接

扫一扫

专栏目录