python汉字的unicode编码_python解决汉字编码问题：Unicode Decode Error

最新推荐文章于 2024-08-05 04:05:49 发布

weixin_39788740

最新推荐文章于 2024-08-05 04:05:49 发布

阅读量1k

点赞数

文章标签： python汉字的unicode编码

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_39788740/article/details/111883587

版权

前言

最近由于项目需要，需要读取一个含有中文的txt文档，完了还要保存文件。文档之前是由base64编码，导致所有汉字读取显示乱码。项目组把base64废弃之后，先后出现两个错误：

ascii codec can't encode characters in position ordinal not in range 128

UnicodeDecodeError: ‘utf8' codec can't decode byte 0x。

如果对于ascii、unicode和utf-8还不了解的小伙伴，可以看之前的这篇文章关于字符串和编码

那么必须对下面这三个概念有所了解：

ascii只能表示数字、英文字母和一些特殊符号，不能表示汉字

unicode和utf-8都可以表示汉字，unicode是固定长度，utf-8是可变长度

内存中存储方式一般为unicode，而磁盘文件存储方式一般为utf-8，因为utf-8可以节约存储空间

那么python的默认编码是什么？

>>> import sys

>>> sys.getdefaultencoding()

'ascii'

>>> reload(sys)

>>> sys.setdefaultencoding('utf-8')

>>> sys.getdefaultencoding()

'utf-8'

python的默认编码是ascii，可以通过sys.setdefaultencoding('utf-8')函数设置python的默认编码。

python中可以通过encode和decode的方式改变数据的编码，比如：

>>> u'汉字'

u'u6c49u5b57'

>>> u'汉字'.encode('utf-8')

'xe6xb1x89xe5xadx97'

>>> u'汉字'.encode('utf-8').decode('utf-8')

u'u6c49u5b57'

我们可以通过这两个函数设置编码。

那么，python中的str是什么类型？

>>> import binascii

>>> '汉字'

'xbaxbaxd7xd6'

>>> type('汉字')

>>> print binascii.b2a_hex('汉字')

babad7d6

>>> print binascii.b2a_hex(u'汉字')

Traceback (most recent call last):

File "", line 1, in

UnicodeEncodeError: 'ascii' codec can't encode characters in

position 0-1: ordinal not in range(128)

>>> print binascii.b2a_hex(u'汉字'.encode('utf-8'))

e6b189e5ad97

>>> print binascii.b2a_hex(u'汉字'.encode('gbk'))

babad7d6

binascii是将数据的二进制转换成ascii，上面的解释是：‘汉字’的类型是str，二进制是babad7d6，u‘汉字’是无法转换成ascii，这样就报出了开头的第一个错误。解决办法就是把它.encode(‘utf-8′)成str类型。因为我命令行是windows默认的GBK编码，所有u’汉字’.encode(‘gbk')

weixin_39788740

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
python汉字的unicode编码_python解决汉字编码问题：Unicode Decode Error

前言最近由于项目需要，需要读取一个含有中文的txt文档，完了还要保存文件。文档之前是由base64编码，导致所有汉字读取显示乱码。项目组把base64废弃之后，先后出现两个错误：ascii codec can't encode characters in position ordinal not in range 128UnicodeDecodeError: ‘utf8' codec can't ...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。