python爬虫常见报错_python爬虫入门常见错误集合

在入门爬虫的时候遇到不少问题,和不是唯一的解决方法的方法,总结整理一下,供大家学习交流。

syntaxerror: invalid syntax语法错误:无效语法

syntaxerror: unexpected EOF while parsing语法错误:多了无法解析的符号(检查是否多了或少了括号)

syntaxerror: invalid character in identifier语法错误:有无效标识符(检查中文符号)

indexerror: list index out of range索引错误:列表超出索引范围(检查列表是否为空)

typeerror: must be str, not int类型错误:数据不是正确的数据类型,比如字符串和数字直接拼接(检查数据类型)

indentationerror: expected an indented block缩进错误:检查代码的缩进是否正确

valueerror: substring not found值错误:输入的数据类型跟要求不符合

nameerror: name ‘a’ is not defined未初始化对象,变量没有被定义

attributeerror: ‘tuple’ object has no attribute 'remove’属性错误:该对象没有这个属性、方法(检查数据类型)

10.网页出现乱码,出现乱码的原因是因为网页解码过程中没有设置如何编码

1)response.encoding = response.apparent_encoding

11.请求头参数

InvalidHeader: Invalid return character or leading space in header: User-Agent

import requests

headers = {

'User-Agent': ' Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/84.0.4128.3 Safari/537.36'

}

response = requests.get('http://www.shuquge.com/txt/8659/index.html', headers=headers)

response.encoding = response.apparent_encoding

html = response.text

print(html)

其实很难发现问题在哪,但事实上是因为‘ Mozilla’之前多了个空格,把空格删去即可

12. requests.exceptions.ConnectionError: HTTPConnectionPool(host=‘134.175.188.27’, port=5010): Max retries exceeded with url: /get (Caused by NewConnectionError(’: Failed to establish a new connection: [WinError 10061] 由于目标计算机积极拒绝,无法连接。’,))

目标计算机积极拒绝

被识别了

网址输入错误了

服务器停止提供服务器了

总的来说,一定要耐心,没有解决不了的问题,兴趣是最好的方法。

  • 0
    点赞
  • 3
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
当进行Python爬虫开发时,常见报错包括但不限于以下几种: 1. 网络连接错误:在进行网络请求时,可能会遇到网络连接错误,例如超时、拒绝连接等。这通常是由于网络不稳定或目标网站限制导致的。 2. HTTP错误:在进行网页请求时,可能会遇到HTTP错误,例如404 Not Found、500 Internal Server Error等。这通常是由于目标网页不存在或服务器内部错误导致的。 3. 解析错误:在解析网页内容时,可能会遇到解析错误,例如HTML解析错误、JSON解析错误等。这通常是由于网页结构变化或数据格式不符合预期导致的。 4. 验证码识别问题:有些网站为了防止爬虫,会设置验证码。当爬虫遇到验证码时,需要进行验证码识别或手动输入验证码才能继续访问。 5. 反爬虫策略:为了防止被爬虫抓取数据,一些网站会采取反爬虫策略,例如设置访问频率限制、用户代理检测等。当爬虫触发了反爬虫策略时,可能会被封禁或返回错误信息。 6. 数据库操作错误:在进行数据存储时,可能会遇到数据库操作错误,例如连接失败、表不存在等。这通常是由于数据库配置错误或操作不当导致的。 7. 其他异常错误:除了上述常见报错,还可能会遇到其他各种异常错误,例如文件读写错误、内存溢出等。这些错误通常是由于代码逻辑错误或环境配置问题导致的。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值