python - 文本处理之解码编码decode encode

最新推荐文章于 2024-06-28 21:28:51 发布

原创最新推荐文章于 2024-06-28 21:28:51 发布 · 2.4k 阅读

·

0

·

CC 4.0 BY-SA版权

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

文章标签：

python 专栏收录该内容

120 篇文章

订阅专栏

本文介绍了Python中字符串编码与解码的基本概念及操作方法，包括Unicode与不同编码间的转换、特殊字符处理、字符串与二进制之间的转换等内容。

目录

(1)字符串编码常用类型

(2)gb2312转为utf-8

(3)转码异常

(4)u'string'指定unicode类型

(5)r'string'禁止转义

(6)字符串转为二进制

(7)二进制转成字符串

1.decode解码

python3后，字符串在Python内部为unicode编码，因此解码为将其他编码转成unicode

(1)语法参数

用于将 bytes 类型的二进制数据转换为 str 类型，这个过程也称为“解码”

语法：str.decode(encoding='UTF-8',errors='strict')

encoding -- 使用的编码，utf-8,gb2312,cp936,gbk。

errors -- 异常处理方案'ignore', 'replace', 'xmlcharrefreplace', 'backslashreplace'等

(2)decode例子

s.decode("utf-8", "ignore") 忽略其中有异常的编码

s.decode("utf-8", "replace") 替换其中异常的编码

#以gb2312编码对字符串str进行解码，以获取unicode u1 = str.decode('gb2312')

2.encode编码

(1)语法参数

encode用于将 str 类型转换成 bytes 类型，这个过程也称为“编码”

语法:str.encode(encoding='UTF-8',errors='strict')

encoding -- 使用的编码，utf-8,gb2312,cp936,gbk。

errors -- 异常处理方案'ignore', 'replace', 'xmlcharrefreplace', 'backslashreplace'等

(2)encode例子

str = "this is string example....wow!!!";

print("Encoded String: " + str.encode('base64','strict'))

3.特殊符号

(1)特殊符号介绍

回车符(\r)、换行符(\n)、水平制表符(\t)、垂直制表符(\v)、换页符(\f)）

(2)去掉特殊符号

" xyz ".strip() #去掉前后空格

s.replace('\t','|') #替换制表符

s.strip('\n') #去掉前后换行符

s.replace("\n", "") #替换换行符

(3)转义字符

反斜杠是转义字符，必须用两个反斜杠'\\'来表示反斜杠

两个反斜杠就要用四个反斜杠来表示'\\\\'

a=r'F:\百度云同步盘\Buyerid/SmartOmi buyer id &order id 201611.1-2016.12.31.txt'

b=a.replace('\\','/')

4.常用操作

(1)字符串编码常用类型

utf-8,gb2312,cp936,gbk

(2)gb2312转为utf-8

s.decode('gb2312').encode('utf-8')

(3)转码异常

s.decode('gbk', 'ignore').encode('utf-8')

(4)u'string'指定unicode类型

在python2k中u表示unicode string，类型是unicode, 没有u表示byte string，类型是 str。

在python3中所有字符串都是unicode string, u前缀没有特殊含义了。

(5)r'string'禁止转义

字符串前面加r，表示的意思是禁止字符串转义,说明字符串r"XXX"中的XXX是普通字符。

(6)字符串转为二进制

encode用于字符串类型转换为二进制类型

s1='apple'

s2=s1.encode('utf-8')

print(s2)

#b'apple'

(7)二进制转成字符串

s1=b'apple'

s2=s1.decode('utf-8')

评论 1

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。