写爬虫过程中的常见问题与错误

在使用requests进行爬虫时,可能会遇到网页乱码、InvalidHeader错误和请求不到页面数据的问题。解决方法包括设置正确的编码方式以避免乱码,删除User-Agent头部的多余空格以消除InvalidHeader错误,以及针对由js渲染的内容,通过检查Network中的js文件获取所需数据和对应的Headers。
摘要由CSDN通过智能技术生成

requests

错误一:网页出现乱码在这里插入图片描述

出现乱码的原因是因为网页解码过程中没有设置如何编码,使用如下代码即可:

html = requests.get(url,headers = headers)
html.encoding = 'gbk'#定义编码方式

错误二:InvalidHeader: Invalid return character or leading space in header: User-Agent

对于初学爬虫的小伙伴而言,这非常令人摸不着头脑,我们来看看错误的headers:

headers 
  • 1
    点赞
  • 4
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值