【Python】python3 正则爬取网页输出中文乱码解决

最新推荐文章于 2024-04-26 15:14:42 发布

dingziqin01862

最新推荐文章于 2024-04-26 15:14:42 发布

阅读量377

点赞数

文章标签： python

原文链接：http://www.cnblogs.com/Liuyt-61/p/7966923.html

版权

【Python】python3 正则爬取网页输出中文乱码解决

爬取网页时候print输出的时候有中文输出乱码

例如：

\\xe4\\xb8\\xad\\xe5\\x8d\\x8e\\xe4\\xb9\\xa6\\xe5\\xb1\\x80

#爬取https://read.douban.com/provider/all出版社
pattern='<div class="name">(.*?)</div>'
import urllib.request
data = urllib.request.urlopen("https://read.douban.com/provider/all").read()
result = re.compile(pattern).findall(str(data))

print(result)

百度了使用encode 和decode 使用codecs都不好使。

应该在爬取网页read()的时候就修改编码格式

#爬取https://read.douban.com/provider/all出版社
pattern='<div class="name">(.*?)</div>'
import urllib.request
data = urllib.request.urlopen("https://read.douban.com/provider/all").read().decode("UTF-8")
result = re.compile(pattern).findall(str(data))
print(result)