Python—UnicodeEncodeError: 'ascii' codec can't encode/decode characters

最新推荐文章于 2024-06-23 17:59:26 发布

北辰

最新推荐文章于 2024-06-23 17:59:26 发布

阅读量936

点赞数

分类专栏： python 文章标签： python ascii encoding

python 专栏收录该内容

6 篇文章 0 订阅

订阅专栏

初学Python被编码格式搞的很头大，以下bug是遇到的编码问题之一：

【BUG】UnicodeEncodeError: 'ascii' codec can't encode characters in position 0-15: ordinal not in range(128)或者UnicodeDecodeError: 'ascii' codec can't decode byte 0x?? in position 1: ordinal not in range(128)

在python在安装时，默认的编码是ascii，当程序中出现非ascii编码时，python的处理常常会报这样的错，python没办法处理非ascii编码的，此时需要自己设置将python的默认编码，一般设置为utf8的编码格式。

查询系统默认编码可以在解释器中输入以下命令：

    Python代码   
    
 >>>sys.getdefaultencoding()

设置默认编码时使用：

    Python代码   
    
 >>>sys.setdefaultencoding('utf8')

可能会报AttributeError: 'module' object has no attribute 'setdefaultencoding'的错误，执行reload(sys)，在执行以上命令就可以顺利通过。

此时在执行sys.getdefaultencoding()就会发现编码已经被设置为utf8的了，但是在解释器里修改的编码只能保证当次有效，在重启解释器后，会发现，编码又被重置为默认的ascii了，那么有没有办法一次性修改程序或系统的默认编码呢。

有2种方法设置python的默认编码：

一个解决的方案在程序中加入以下代码：

    Python代码   
    
  
 import sys  
 reload(sys)  
 sys.setdefaultencoding('utf8')   

另一个方案是在python的Lib\site-packages文件夹下新建一个sitecustomize.py，内容为：

    Python代码   
    
  
 # encoding=utf8  
 import sys  
   
 reload(sys)  
 sys.setdefaultencoding('utf8')   

此时重启python解释器，执行sys.getdefaultencoding()，发现编码已经被设置为utf8的了，多次重启之后，效果相同，这是因为系统在python启动的时候，自行调用该文件，设置系统的默认编码，而不需要每次都手动的加上解决代码，属于一劳永逸的解决方法。

另外有一种解决方案是在程序中所有涉及到编码的地方，强制编码为utf8，即添加代码encode("utf8")，这种方法并不推荐使用，因为一旦少写一个地方，将会导致大量的错误报告。

【转】http://shirley-ren.iteye.com/blog/1018750

附带:python unicode和普通字符串之间的转换:

   #将Unicode转换成普通的Python字符串:"编码(encode)":

   unicodestring = u"Hello world"

   utf8string = unicodestring.encode("utf-8")

   asciistring = unicodestring.encode("ascii")

   isostring = unicodestring.encode("ISO-8859-1")

   utf16string = unicodestring.encode("utf-16")


   #将普通的Python字符串转换成Unicode: "解码(decode)"

   plainstring1 = unicode(utf8string, "utf-8")

   plainstring2 = unicode(asciistring, "ascii")

   plainstring3 = unicode(isostring, "ISO-8859-1")

   plainstring4 = unicode(utf16string, "utf-16")


   example:
   assert plainstring1==plainstring2==plainstring3==plainstring4