scrapy起始地址是从文件读取的解决办法

文子阳

已于 2022-02-25 11:06:12 修改

阅读量8.8w

点赞数

分类专栏：爬虫文章标签： python 开发语言后端

于 2021-08-14 19:54:10 首次发布

本文链接：https://blog.csdn.net/wenxingchen/article/details/119705336

版权

爬虫专栏收录该内容

23 篇文章 4 订阅

订阅专栏

如果起始地址很多,是从文件读取的就无法使用start_urls=[]的形式了,需要重写start_requests方法来加载起始URL.

    def start_requests(self):
        self.urls = []
        with open('D:\Java\program\myscrapy\hot\hot\htmls.txt', 'r') as f:
            self.urls = f.readlines()

        for url in self.urls:
            time.sleep(2)
            yield scrapy.Request(url=url, callback=self.parse)

为了防止发送速度太快,容易引起反扒机制,每个请求阻塞两秒.

还要在settings.py文件中设置并发参数

CONCURRENT_REQUESTS = 2

# Configure a delay for requests for the same website (default: 0)
# See https://docs.scrapy.org/en/latest/topics/settings.html#download-delay
# See also autothrottle settings and docs
#DOWNLOAD_DELAY = 3
# The download delay setting will honor only one of:
CONCURRENT_REQUESTS_PER_DOMAIN = 2
CONCURRENT_REQUESTS_PER_IP = 2

确定要放弃本次机会？

福利倒计时

: :

立减 ¥

普通VIP年卡可用

立即使用

文子阳

关注关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
打赏
0
评论
scrapy起始地址是从文件读取的解决办法

如果起始地址很多,是从文件读取的就无法使用start_urls=[]的形式了,需要重写start_requests方法来加载起始URL. def start_requests(self): self.urls = [] with open('D:\Java\program\myscrapy\hot\hot\htmls.txt', 'r') as f: self.urls = f.readlines() for url in
复制链接

扫一扫