python2.7 pyspark显示以及插入hive表中文编码问题

最新推荐文章于 2024-07-05 03:31:56 发布

南之一舟

最新推荐文章于 2024-07-05 03:31:56 发布

阅读量953

点赞数

分类专栏： pyspark 文章标签：大数据

本文链接：https://blog.csdn.net/qq_38103657/article/details/111873776

版权

pyspark 专栏收录该内容

3 篇文章 0 订阅

订阅专栏

我用python2.7的环境下读取excel，这个时候print pandas的dataframe时中文是可以显示的，说明不是python2.7的问题，然后将其转换成spark的dataframe的时候，show或者write到hive表的时候出现了中文乱码，这个时候我使用了pyspark.sql.functions.decode和encode函数，首先将它从utf-8进行解码，然后以ISO-8859-1进行编码，此时中文可以正常显示。

df = df.withColumn(column,encode(decode(col(column),'UTF-8'),'ISO-8859-1'))