requests包get响应内容中文乱码解决方案

最新推荐文章于 2024-07-12 16:58:11 发布

LI4836

最新推荐文章于 2024-07-12 16:58:11 发布

阅读量324

点赞数

分类专栏： Python 文章标签： python

原文链接：https://blog.csdn.net/feixuedongji/article/details/82984583

版权

Python 专栏收录该内容

89 篇文章 2 订阅

订阅专栏

python中的编码
字符串在Python内部的表示是unicode编码，因此，在做编码转换时，通常需要以unicode作为中间编码，即先将其他编码的字符串解码（decode）成unicode，再从unicode编码（encode）成另一种编码。

decode的作用是将其他编码的字符串转换成unicode编码，如str1.decode(‘gb2312’)，表示将gb2312编码的字符串str1转换成unicode编码，encode的作用是将unicode编码转换成其他编码的字符串，如str2.encode(‘gb2312’)，表示将unicode编码的字符串str2转换成gb2312编码。

因此，转码的时候一定要先搞明白，字符串str是什么编码，然后decode成unicode，然后再encode成其他编码。

requests中的编码
先上结论：之所以request的响应内容乱码，是因为模块中并没有正确识别出encoding的编码，而s.txt的结果是依靠encoding的编码“ISO-8859-1”解码出的结果，所以导致乱码。

所以正确的逻辑应该这样：

s = requests.get('http://www.vuln.cn')

一般可以先判断出编码，比如编码为gb2312，

str = s.content

可以直接用正确的编码来解码。

str.decode('gb2312')

那么知道这个逻辑，接下来就是需要正确判断网页编码就行了，获取响应html中的charset参数：

<meta http-equiv="Content-Type" content="text/html; charset=UTF-8">

但实际上我们可以直接执行encoding为正确编码，让response.text正确解码即可：

response=requests.get('www.test.com')

response.encoding = response.apparent_encoding

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
requests包get响应内容中文乱码解决方案

python中的编码字符串在Python内部的表示是unicode编码，因此，在做编码转换时，通常需要以unicode作为中间编码，即先将其他编码的字符串解码（decode）成unicode，再从unicode编码（encode）成另一种编码。decode的作用是将其他编码的字符串转换成unicode编码，如str1.decode(‘gb2312’)，表示将gb2312编码的字符串str1转换...
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。