最近在学习scrapy,写好了大概的样子,但是却发现无法循环抓取,最后自己想着以前貌似有个例子说过原因。
- 之前写的如下:
name = 'dmoz'
allowed_domains = ['dmoz.org']
start_urls = ['http://www.123.info/']
- 修改之后如下:
name = 'dmoz'
allowed_domains = ['123.info']
start_urls = ['http://www.123.info/']
为了实现yield当前站循环抓取,需要将allowed_domains改为与url一致的域名才行,也就是如果想抓取123.info的全站链接,需要将allowed_domains设置为123.info就可以通过Request实现循环抓取了