Python字符编码及应用

最新推荐文章于 2022-06-29 14:26:45 发布

qff1987

最新推荐文章于 2022-06-29 14:26:45 发布

阅读量329

点赞数

本文链接：https://blog.csdn.net/u013465115/article/details/105147579

版权

字符集概念
字符集就是一套文字符号及其编码的描述。从第一个计算机字符集ASCII开始，为了处理不同的文字，发明过几百种字符集，例如ASCII、USC、GBK、BIG5等，这些不同的字符集从收录到编码都各不相同。在编程中出现比较严重的问题是字符乱码。
几个概念
位：计算机的最小单位二进制中的一位，用二进制的0，1表示。
字节：八位组成一个字节。（位与字节有对应关系）
字符：我们肉眼可见的文字与符号。（字节和字符没有对应关系，不同的编码体系中都是不同的）
字符集：字符的集合。
编码：将字符转换成计算机可识别的0，1代码。
解码：将计算机表示的0，1编码转换成肉眼可见的字符。
字符编码的起源：ASCLL
第一代计算机的时候就确定了以二进制方式存储数据的基本逻辑，所以我们所见的所有信息，要想持久化就必须转换成计算机可识别的二进制编码，所以就必须建立一套字符对应二进制的对应关系。当时使用的所有字符（一共128个）采用8个二进制位来建立了字符和对应的二进制编码的对应关系，一共128个占7位，高位补0，所以共8位，也就是说一个字符占用一个字节。
字符编码的发展：GBK和GB2312
GB2312编码收录了常用汉字。在计算机传入中国后，国家面临字符编码相关的问题，所以当时就制定了一套双字节编码规范，收录了中文、东亚文字及欧美文字，所有的字母采用两个字节进行编码。GBK是GB2312的扩展字符集，支持繁体字，占用2bytes。Big5中国台湾支持的编码技术。EASCII欧洲国家联合进行的统一编码技术，是单字节编码。
字符编码的现状：Unicode
UCS系列，随着信息交流频繁和字符乱码问题越来越严重，统一编码的需求越来越强烈，IOS组织提出了统一的编码方案。规则是：所有的字符采用四个字节进行编码；将整个编码空间划分为四个部分（组、面、行、列），最高位固定为0。Unicode系列在UCS-4编码推出后遭受到一些大公司反对后，由一些大公司如google、IBM、SUN等公司成立Unicode委员会，研发的编码和解码规范。
UTF-8
基于节约的原则，出现了把Unicode编码转化为“可变长编码”的UTF-8编码。把一个Unicode字符根据不同的数字大小编码成1-6个字节，常用的英文字母被编码成1个字节，汉字通常为3个字节，只有较生僻的字符才会被编码成4-6个字节。
Python的字符串
在python3中字符串是以Unicode编码的，字符串默认支持多语言。
ord()：将字符转换成整数表示，只接受单个字符。
chr()：将整数转换成对应的文字。
在这里插入图片描述

在客户端与服务端的网络传输中，字符串无法直接传输，需要转换成bytes类型。如：

可以看出，在字符串前加上一个b就是bytes类型。当使用汉字时，我们使用编码和解码方式进行转换：
encode()：将字符串转为bytes类型。
decode()：将bytes类型转为字符串。
在这里插入图片描述