Scrapy爬虫错误日志汇总

最新推荐文章于 2023-03-29 11:10:58 发布

weixin_34143774

最新推荐文章于 2023-03-29 11:10:58 发布

阅读量324

点赞数

文章标签：爬虫 python c/c++

原文链接：https://yq.aliyun.com/articles/691479

版权

Scrapy爬虫错误日志汇总

1、数组越界问题(list index out of range)

原因：第1种可能情况：list[index]index超出范围,也就是常说的数组越界。

　　　第2种可能情况：list是一个空的，没有一个元素，进行list[0]就会出现该错误，这在爬虫问题中很常见，比如有个列表爬下来为空，统一处理就会报错。

解决办法：从你的网页内容解析提取的代码块中找找看啦（人家比较习惯xpath + 正则），加油 ~

2、http状态代码没有被处理或允许(http status code is not handled or not allowed)

原因：就是你的http状态码没有被识别，需要在settings.py中添加这个状态码信息，相当于C语言中的＃define预处理宏定义命令吧（我这么理解）

解决办法：在你的setting.py中，添加这么一句短小精悍的话就OK了，紧接着就等着高潮吧您呐：HTTPERROR_ALLOWED_CODES = [403]

此篇文章持续更新，未完待续....

欢迎大家留下自己的问题，互相讨论，互相学习，互相总结，，，，

原文地址https://www.cnblogs.com/beiyi888/p/10437232.html

weixin_34143774

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Scrapy爬虫错误日志汇总

Scrapy爬虫错误日志汇总1、数组越界问题(list index out of range)原因：第1种可能情况：list[index]index超出范围,也就是常说的数组越界。　　　第2种可能情况：list是一个空的，没有一个元素，进行list[0]就会出现该错误，这在爬虫问题中很常见，比如有个列表爬下来为空，统一处理就会报错。解决办法：...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。