Python3 scrapy 无法爬取下一页的问题

最新推荐文章于 2023-11-27 20:57:42 发布

weixin_30896825

最新推荐文章于 2023-11-27 20:57:42 发布

阅读量1.1k

点赞数 1

文章标签： python 爬虫数据库

原文链接：http://www.cnblogs.com/passagain/p/10822352.html

版权

导致request失效的原因有两个，下面是解决方法

第一，更改代码 allowe_domains 内容

class XXSpider(scrapy.Spider):
    name = 'xxspider'
    allowed_domains = ['www.xx.com']   #一定不要带有https://开头
    start_urls = ['https://www.xx.com/xxxyyy/']

第二，更改Request函数过滤器

yield scrapy.Request(next_url, call_back=self.parse, dont_filter=True) 
#增加代码，不过滤为真

转载于:https://www.cnblogs.com/passagain/p/10822352.html

确定要放弃本次机会？

福利倒计时

: :

立减 ¥

普通VIP年卡可用

立即使用

weixin_30896825

关注关注

1
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
Python3 scrapy 无法爬取下一页的问题

导致request失效的原因有两个，下面是解决方法第一，更改代码 allowe_domains 内容class XXSpider(scrapy.Spider): name = 'xxspider' allowed_domains = ['www.xx.com'] #一定不要带有https://开头 start_urls = ['https:/...
复制链接

扫一扫