python爬取网页有乱码怎么解决_Python抓取网页乱码的解决方法分析

最新推荐文章于 2023-11-07 17:12:44 发布

weixin_39890102

最新推荐文章于 2023-11-07 17:12:44 发布

阅读量1.3k

点赞数

文章标签： python爬取网页有乱码怎么解决

本文详细介绍了Python抓取网页时遇到的乱码问题及其解决方案，包括通过decode和encode处理编码不一致的情况，以及如何处理启用gzip压缩的网页。推荐使用requests模块避免这些问题。

摘要由CSDN通过智能技术生成

Python抓取网页乱码的原因及解决方法

本篇文章给大家带来的内容是关于Python抓取网页乱码的原因及解决方法，有一定的参考价值，有需要的朋友可以参考一下，希望对你有所帮助。

在用 python2 抓取网页的时候，经常会遇到抓下来的内容显示出来是乱码。

发生这种情况的最大可能性就是编码问题：运行环境的字符编码和网页的字符编码不一致。

比如，在 windows 的控制台（gbk）里抓取了一个 utf-8 编码的网站。或者，在 Mac / Linux 的终端（utf-8）里抓取了一个 gbk 编码的网站。因为多数网站采用 utf-8 编码，而不少人又是用 windows，所有这种情况相当常见。

如果你发现你抓下来的内容，看上去英文、数字、符号都是对的，但中间夹杂了一些乱码，那基本可以断定是此情况。

解决这个问题的办法就是，把结果先按网页的编码方式 decode 解码成 unicode，再输出。如果不确定网页的编码，可参照以下代码：

import urllib

req = urllib.urlopen("http://some.web.site")

info = req.info()

charset = info.getparam('charset')

content = req.read()

print content.decode(charset, 'ignore')

最低0.47元/天解锁文章

weixin_39890102

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
python爬取网页有乱码怎么解决_Python抓取网页乱码的解决方法分析

Python抓取网页乱码的原因及解决方法本篇文章给大家带来的内容是关于Python抓取网页乱码的原因及解决方法，有一定的参考价值，有需要的朋友可以参考一下，希望对你有所帮助。在用 python2 抓取网页的时候，经常会遇到抓下来的内容显示出来是乱码。发生这种情况的最大可能性就是编码问题：运行环境的字符编码和网页的字符编码不一致。比如，在 windows 的控制台（gbk）里抓取了一个 utf-8...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。