python编码问题2

最新推荐文章于 2023-08-31 15:31:21 发布

遇见更好的自己

最新推荐文章于 2023-08-31 15:31:21 发布

阅读量385

点赞数

分类专栏： python语法文章标签： python编码

python语法专栏收录该内容

2 篇文章 0 订阅

订阅专栏

0x00 字符的编码

计算机毕竟是西方国家的发明，最开始并没有想到会普及到全世界，只用一个字节中的7位（ASCII）来表示字符对于现在庞大的文字数量来说显然不够，所以先后经历了好几套编码方案，不同国家和地区又有自己的方案，造成了现在诸多的历史遗留问题。具体讲述编码原理请看这篇文章：PYTHON编码的前世今生

0x01 Python中的字符串

Python有两种不同的字符串，一种存储文本，一种存储字节。对于文本，Python内部采用Unicode存储，而字节字符串显示原始字节序列或者ASCII。

什么叫编码（encode）？

按照字面意思和以往经验，我要把这个文本或字符串用“UTF-8”编码，感觉上应该是对字节数据进行编码然后显示正确的文字。大多数人都是这么想的，可事实呢？

编码的意思是将Unicode字符按照编码规则（如UTF-8）编成字节序列：

这里写图片描述

有人此时会问，我用 print 语句打印出来怎么是乱码或者是中文，并不是字节序列。这是因为你调用 print 语句的时候，默认进行了隐式解码，为的是让人类看见友好的字符数据，也就是默认的进行了str()包装，想看见背后真正的十六进制数，你需要调用魔术方法 _repr_() 。

什么叫解码（decode）?

对应的，解码就是将字节序列按照编码规则（如UTF-8）解释成unicode形式。

这里写图片描述

这里或许又会有疑问，编码解码都是十六进制，那中文字符咋显示的？
这又要结合你的环境了。看完我上面推荐的文章，你就会明白，Unicode只是一种标准，而具体的编码才是实现方式。有了正确的Unicode编码，仅仅代表你有了正确的英文文献，想翻译成中文，还得再转换一次。而这一次转换，是你的环境帮你完成。举个例子，你打开一个文档，发现是乱码，多半是文本编辑器的解码方式有问题，换个解码规则就好了。