Python Unicode与中文处理

最新推荐文章于 2024-05-20 11:27:07 发布

dao123mao

最新推荐文章于 2024-05-20 11:27:07 发布

阅读量2w

点赞数 1

分类专栏： python 文章标签： python encoding codec windows character module

本文链接：https://blog.csdn.net/dao123mao/article/details/5396497

版权

python中的unicode是让人很困惑、比较难以理解的问题，本文力求彻底解决这些问题； 1.unicode、gbk、gb2312、utf-8的关系；http://www.pythonclub.org/python-basic/encode-detail这篇文章写的比较好，utf-8是unicode的一种实现方式，unicode、gbk、gb2312是编码字符集； 2.p

摘要由CSDN通过智能技术生成

python中的unicode是让人很困惑、比较难以理解的问题，本文力求彻底解决这些问题；

1.unicode、gbk、gb2312、utf-8的关系；

http://www.pythonclub.org/python-basic/encode-detail这篇文章写的比较好，utf-8是unicode的一种实现方式，unicode、gbk、gb2312是编码字符集；

2.python中的中文编码问题；

2.1 .py文件中的编码

Python 默认脚本文件都是 ANSCII 编码的，当文件中有非 ANSCII 编码范围内的字符的时候就要使用"编码指示"来修正。一个module的定义中，如果.py文件中包含中文字符（严格的说是含有非anscii字符），则需要在第一行或第二行指定编码声明：

# -*- coding=utf-8 -*-或者 #coding=utf-8 其他的编码如：gbk、gb2312也可以；否则会出现类似:SyntaxError: Non-ASCII character '/xe4' in file ChineseTest.py on line 1, but no encoding declared; see http://www.pytho for details这样的异常信息；n.org/peps/pep-0263.html

2.2 python中的编码与解码

先说一下python中的字符串类型，在python中有两种字符串类型，分别是str和unicode，他们都是basestring的派生类；str类型是一个包含Characters represent (at least) 8-bit bytes的序列；unicode的每个unit是一个unicode obj;所以：

len(u'中国')的值是2；len('ab')的值也是2；

在str的文档中有这样的一句话：The string data type is also used to represent arrays of bytes, e.g., to hold data read from a file. 也就是说在读取一个文件的内容，或者从网络上读取到内容时，保持的对象为str类型；如果想把一个str转换成特定编码类型，需要把str转为Unicode,然后从unicode转为特定的编码类型如：utf-8、gb2312等；

python中提供的转换函数：

unicode转为 gb2312,utf-8等

# -*- coding=UTF-8 -*-

if __name__ == '__main__':
s = u'中国'

最低0.47元/天解锁文章

dao123mao

关注

1
点赞
踩
20

收藏

觉得还不错? 一键收藏
1
评论
Python Unicode与中文处理

python中的unicode是让人很困惑、比较难以理解的问题，本文力求彻底解决这些问题； 1.unicode、gbk、gb2312、utf-8的关系；http://www.pythonclub.org/python-basic/encode-detail这篇文章写的比较好，utf-8是unicode的一种实现方式，unicode、gbk、gb2312是编码字符集； 2.p
复制链接

扫一扫