解决python3爬取网页（GB2312编码）中文乱码问题

最新推荐文章于 2020-02-28 21:54:35 发布

weixin_30291791

最新推荐文章于 2020-02-28 21:54:35 发布

阅读量627

点赞数

文章标签： python 爬虫

原文链接：http://www.cnblogs.com/cooper-73/p/9921180.html

版权

　　爬取网页时由于编码格式的问题，导致中文乱码，解决方法就是将原文件转码成latin1编码（使用encode函数），再解码成gbk编码（使用decode函数）

即可输出正确中文。

　　如下：

 1 # coding:UTF-8
 2 
 3 import requests
 4 
 5 headers={'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36',
 6          'Host':'www.dy2018.com'}
 7 
 8 url=('https://www.dy2018.com/1/')
 9  
10 r = requests.get(url,headers=headers)
11 
12 data = r.text.encode("latin1").decode("gbk")  ###将原文件转码成latin1编码（使用encode函数） ，再解码成gbk编码（使用decode函数）
13 
14 with open('t1.txt','w',encoding='utf-8') as f:
15     f.write(data)
16     f.close

转载于:https://www.cnblogs.com/cooper-73/p/9921180.html

确定要放弃本次机会？

福利倒计时

: :

立减 ¥

普通VIP年卡可用

立即使用

weixin_30291791

关注关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
解决python3爬取网页（GB2312编码）中文乱码问题

　　爬取网页时由于编码格式的问题，导致中文乱码，解决方法就是将原文件转码成latin1编码（使用encode函数），再解码成gbk编码（使用decode函数）即可输出正确中文。　　如下： 1 # coding:UTF-8 2 3 import requests 4 5 headers={'User-Agent':'Mozilla/5.0 (Windows N...
复制链接

扫一扫