背景
在大数据 ETL(Extract-Transfer-Load) 过程中,经常需要从不同的数据源来提取数据进行加工处理,比较常见的是从 Mysql 数据库来提取数据,而 Mysql 数据库中数据存储的比较常见方式是使用 json 串进行存储。
通过大数据加工处理出来的数据是需要具有可直观分析的特点,可从数据分析中挖掘出商业价值的。
因此在数据预处理层需要将 json 串进行“拍平”处理,所谓“拍平”是指将 json 中的 key 转换为表的列字段,其 key 对应的 value 值则为列字段对应的值。
“拍平”的处理行业内也可称为“行转列”处理,我举个例子你就能明白什么是行转列了。
举例:
user表字段如下:
| id | detail_info |
|---|---|
| 1 | '{"name":"rocky","age":18,"prefer":"music"}' |
现需要将 user 表中字段 detail_info 中的 json 串值,以每个 key 作为 user_detail_info 表的字段来进行存储。
实现的 user_detail_info 表字段如下:
| id | name | age | prefer |
|---|---|---|---|

本文详细介绍了在Hive中如何使用内置函数get_json_object和json_tuple解析JSON数据,通过实例展示了如何进行“行转列”的数据处理。讨论了两者在处理JSON字段时的差异,并预告了Hive解析JSON数组的方法。
最低0.47元/天 解锁文章
1146

被折叠的 条评论
为什么被折叠?



