爬取网页时候print输出的时候有中文输出乱码
例如:
\\xe4\\xb8\\xad\\xe5\\x8d\\x8e\\xe4\\xb9\\xa6\\xe5\\xb1\\x80
#爬取https://read.douban.com/provider/all出版社 pattern='<div class="name">(.*?)</div>' import urllib.request data = urllib.request.urlopen("https://read.douban.com/provider/all").read() result = re.compile(pattern).findall(str(data)) print(result)
百度了使用encode 和decode 使用codecs都不好使。
应该在爬取网页read()的时候就修改编码格式
#爬取https://read.douban.com/provider/all出版社 pattern='<div class="name">(.*?)</div>' import urllib.request data = urllib.request.urlopen("https://read.douban.com/provider/all").read().decode("UTF-8") result = re.compile(pattern).findall(str(data)) print(result)
还有一些中文乱码的处理在这儿可能详细点儿,也是这给我启发让我搞定这个乱码。https://www.cnblogs.com/lmei/p/5333644.html
----------------------------------------------------------分割线-----------------------------------------------
直接 data = urllib.request.urlopen(url).read().decode("utf-8","ignore")
本文介绍了解决Python3中使用正则表达式爬取网页时遇到的中文乱码问题,通过调整读取网页数据时的编码方式,成功解决了乱码输出,详细解释了如何在爬取阶段设置正确的编码。
1625

被折叠的 条评论
为什么被折叠?



