【Effective Python】3-Pythonic-了解 bytes、str 与 unicode 区别

3-Pythonic-了解 bytes、str 与 unicode 区别

字符序列类型

字符序列类型Python 3Python 2
8位值 (8个二进制)bytesstr
Unicode 字符strunicode

Python 3 的 str 实例和 Python 2 的 unicode 实例都没有和特定的二进制编码形式相关联;
换句话说,Unicode字符 转换为 二进制数据 有很多编码方式,其中最常见的是 UTF-8。

编码与解码

  • Unicode 字符 --> 二进制数据,称为编码 encode
  • 二进制数据 --> Unicode 字符,称为解码 decode

编写 Python 程序的时候,一定要把编码和解码放在最外围来做。

使用情形(Python 3)

  • 使用情形

    • 需要将 Unicode 字符 --> UTF-8 编码后的二进制数据
    • 需要操作没有特定编码形式的 Unicode字符
  • 解码

def to_str(bytes_or_str):
    if isinstance(bytes_or_str, bytes):
        value = bytes_or_str.decode('utf-8')
    else:
        value = bytes_or_str
    return value # Instance of str
  • 编码
def to_str(bytes_or_str):
    if isinstance(bytes_or_str, str):
        value = bytes_or_str.encode('utf-8')
    else:
        value = bytes_or_str
    return value # Instance of bytes

可能的问题(Python 3)

如果使用内置函数 open 获取了文件句柄(file handle)。那么请注意,该句柄默认采用 UTF-8 的编码格式来操作文件。

  • 问题:如果向文件中随机写入一些二进制数据,下面代码可能会出错。
with open('/tmp/random.bin', 'w')as f:
    f.write(os.urandom(10))
>>>
TypeError: must be str, not bytes
  • 原因:Python 3 给 open 函数添加了名为 encoding 的新参数,而这个参数的默认值就是 ‘utf-8’。

  • 解决方案,用二进制写入模式(‘wb’)来开启待操作的文件。

with open('/tmp/random.bin', 'wb')as f:
    f.write(os.urandom(10))
  • 读取数据也类似,用(‘rb’)来打开文件。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值