pyspider爬网页出现中文乱码的解决办法

最新推荐文章于 2022-03-10 17:59:15 发布

p是马甲

最新推荐文章于 2022-03-10 17:59:15 发布

阅读量388

点赞数

原文链接：http://www.cnblogs.com/alpiny/p/10773701.html

版权

为什么会出现乱码呢？按照binux的说法

这就是 lxml 的蛋疼之处，给它 unicode 它有的时候它不认，给它 bytes 它又处理不好

方法1：

response.content = (response.content).decode('utf-8') #目标站是 utf-8 编码

方法2：

response.content = response.content.decode('gbk', errors='ignore')#目标站是gbk

方法3：（binux的方案）

import pyquery
doc = pyquery.PyQuery(response.text)

方案3的好处是，不必知道源站编码，而直接由pyquery来接管。

转载于:https://www.cnblogs.com/alpiny/p/10773701.html

确定要放弃本次机会？

福利倒计时

: :

立减 ¥

普通VIP年卡可用

关注关注