python查看汉字的编码_python有关汉字编码问题

最新推荐文章于 2024-08-07 22:32:38 发布

一簇金银花

最新推荐文章于 2024-08-07 22:32:38 发布

阅读量1k

点赞数

文章标签： python查看汉字的编码

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_36247891/article/details/112936203

版权

python分为：程序编码(python安装程序)、文件编码。

查看程序编码方式：sys.getdefaultencoding()

查看文件编码方式：1.import chardet 2. f = open('lianxi1-qus.py') data = f.read() print chardet.detect(data)

字符编码发展历程：ASCII——(gb2312——(1995)gb18030——gbk——)unicode——UTF-8

ASCII:不能存中文，一个字节，8位

gb2312：能存

gb18030：能存2万多个中文

gbk:windows中都是用gbk表示中文，不是UTF-8

unicode:万能编码，占2个字节、16位。

Linux默认utf-8，Windows默认GB2312

详细字符编码查看：https://blog.csdn.net/apache0554/article/details/53889253

python3默认编码是unicode，python之前为：UTF-8

UTF-8:作为ASCII与unicode的中间码，可伸缩的。

字符串在Python内部的表示是unicode编码，因此，在做编码转换时，通常需要以unicode作为中间编码，即先将其他编码的字符串解码(decode)成unicode，再从unicode编码(encode)成另一种编码。

decode的作用是将其他编码的字符串转换成unicode编码，如str1.decode('gb2312')，表示将gb2312编码的字符串str1转换成unicode编码。

encode的作用是将unicode编码转换成其他编码的字符串，如str2.encode('gb2312')，表示将unicode编码的字符串str2转换成gb2312编码。

因此，转码的时候一定要先搞明白，字符串str是什么编码，然后decode成unicode，然后再encode成其他编码

代码中字符串的默认编码与代码文件本身的编码一致。

如：s='中文'

如果是在utf8的文件中，该字符串就是utf8编码，如果是在gb2312的文件中，则其编码为gb2312。这种情况下，要进行编码转换，都需要先用decode方法将其转换成unicode编码，再使用encode方法将其转换成其他编码。通常，在没有指定特定的编码方式时，都是使用的系统默认编码创建的代码文件。

如果字符串是这样定义：s=u'中文'

则该字符串的编码就被指定为unicode了，即python的内部编码，而与代码文件本身的编码无关。因此，对于这种情况做编码转换，只需要直接使用encode方法将其转换成指定编码即可。

如果一个字符串已经是unicode了，再进行解码则将出错，因此通常要对其编码方式是否为unicode进行判断：

isinstance(s, unicode) #用来判断是否为unicode

用非unicode编码形式的str来encode会报错

如何获得系统的默认编码？

#!/usr/bin/env python

#coding=utf-8

import sys

print sys.getdefaultencoding()

该段程序在英文WindowsXP上输出为：ascii

在某些IDE中，字符串的输出总是出现乱码，甚至错误，其实是由于IDE的结果输出控制台自身不能显示字符串的编码，而不是程序本身的问题。

如在UliPad中运行如下代码：

s=u"中文"

print s

会提示：UnicodeEncodeError: 'ascii' codec can't encode characters in position 0-1: ordinal not in range(128)。这是因为UliPad在英文WindowsXP上的控制台信息输出窗口是按照ascii编码输出的(英文系统的默认编码是ascii)，而上面代码中的字符串是Unicode编码的，所以输出时产生了错误。

将最后一句改为：print s.encode('gb2312')

则能正确输出“中文”两个字。

若最后一句改为：print s.encode('utf8')

则输出：\xe4\xb8\xad\xe6\x96\x87，这是控制台信息输出窗口按照ascii编码输出utf8编码的字符串的结果。

unicode(str,'gb2312')与str.decode('gb2312')是一样的，都是将gb2312编码的str转为unicode编码

有关 ascii，unicode，utf8，gbk 见：http://www.cnblogs.com/guanfuchang/p/5956963.html

查看data文件(程序的编码)的编码格式：print chardet.detect(data)

查看编码类型：type(变量)

查看系统的默认编码：1.improt sys 2.print(sys.getdefaultencoding())

eg:

下载库

pip install chardet

执行

import chardet

f = open('a.doc',r)

data = f.read()

print chardet.detect(data)

结果

{'confidence': 0.64465744, 'encoding': 'utf-8'}

前面是相似度后面是编码格式

一簇金银花

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。