Python中文编码问题

old-windbell

于 2015-08-14 11:31:25 发布

阅读量361

点赞数

分类专栏： python 文章标签： python 编码中文

python 专栏收录该内容

1 篇文章 0 订阅

订阅专栏

本文出自http://www.cnblogs.com/ymy124/archive/2012/06/23/2559282.html
每次python中涉及中文总是出乱码，故抄了篇博客

中文编码问题是用中文的程序员经常头大的问题，在python下也是如此，那么应该怎么理解和解决python的编码问题呢？

我们要知道python内部使用的是unicode编码，而外部却要面对千奇百怪的各种编码，比如作为中国程序经常要面对的gbk，gb2312，utf8等，那这些编码是怎么转换成内部的unicode呢？

首先我们先看一下源代码文件中使用字符串的情况。源代码文件作为文本文件就必然是以某种编码形式存储代码的，python默认会认为源代码文件是asci编码，比如说代码中有一个变量赋值：

s1=’a’
print s1

python认为这个’a’就是一个asci编码的字符。在仅仅使用英文字符的情况下一切正常，但是如果用了中文，比如：

s1=’哈’
print s1

这个代码文件被执行时就会出错，就是编码出了问题。python默认将代码文件内容当作asci编码处理，但asci编码中不存在中文，因此抛出异常。

解决问题之道就是要让python知道文件中使用的是什么编码形式，对于中文，可以用的常见编码有utf-8，gbk和gb2312等。只需在代码文件的最前端添加如下：

# -- coding: utf-8 --

这就是告知python我这个文件里的文本是用utf-8编码的，这样，python就会依照utf-8的编码形式解读其中的字符，然后转换成unicode编码内部处理使用。

不过，如果你在Windows控制台下运行此代码的话，虽然程序是执行了，但屏幕上打印出的却不是哈字。这是由于python编码与控制台编码的不一致造成的。Windows下控制台中的编码使用的

是gbk，而在代码中使用的utf-8，python按照utf-8编码打印到gbk编码的控制台下自然就会不一致而不能打印出正确的汉字。

解决办法一个是将源代码的编码也改成gbk，也就是代码第一行改成：

# -- coding: gbk --

另一种方法是保持源码文件的utf-8不变，而是在’哈’前面加个u字，也就是:

s1=u’哈’
print s1

这样就可以正确打印出’哈’字了。

这里的这个u表示将后面跟的字符串以unicode格式存储。python会根据代码第一行标称的utf-8编码识别代码中的汉字’哈’，然后转换成unicode对象。如果我们用type查看一下’哈’的数据类

型type(‘哈’)，会得到

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Python中文编码问题

python中文乱码
复制链接

扫一扫

专栏目录

old-windbell CSDN认证博客专家 CSDN认证企业博客

码龄11年

6: 原创

127万+: 周排名

113万+: 总排名

2575: 访问

: 等级

117: 积分

0: 粉丝

0: 获赞

2: 评论

3: 收藏

私信

关注

热门文章

分类专栏

数据挖掘 1篇
算法 3篇
机器学习
C++ 3篇
asm 1篇
编程规范 1篇
python 1篇

最新评论

Apriori 算法学习
blackly9: 邮箱：[email protected]
Apriori 算法学习
blackly9: 可以给我发一个代码实现的事列吗？

您愿意向朋友推荐“博客详情页”吗？

强烈不推荐
不推荐
一般般
推荐
强烈推荐

提交

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。