PyCharm下进行Scrapy项目的调试

最新推荐文章于 2024-03-22 12:10:01 发布

股海孙悟空

最新推荐文章于 2024-03-22 12:10:01 发布

阅读量286

点赞数

分类专栏： python 文章标签： python

本文链接：https://blog.csdn.net/qq_32440951/article/details/77938164

版权

python 专栏收录该内容

3 篇文章 0 订阅

订阅专栏

1、首先创建一个Scrapy项目：

在命令行输入：

scrapy startproject project_name

project_name为项目名称，比如我的项目名称为py_scrapyjobbole，生成的目录为：

2、创建新的Spider

在命令行输入：

scrapy genspider jobbole(spider名称) blog.jobbole.com(爬取的起始url)

# -*- coding: utf-8 -*-
import scrapy


class JobboleSpider(scrapy.Spider):
    name = 'jobbole'
    allowed_domains = ['blog.jobbole.com']
    start_urls = ['http://blog.jobbole.com/111322/']

    def parse(self, response):
        re_select = response.xpath('//*[@id="post-111322"]/div[1]/h1')
        pass

3、配置setting.py文件（这步很重要）

BOT_NAME = 'py_scrapyjobbole'

SPIDER_MODULES = ['py_scrapyjobbole.spiders']
NEWSPIDER_MODULE = 'py_scrapyjobbole.spiders'

# Crawl responsibly by identifying yourself (and your website) on the user-agent
# USER_AGENT = 'py_scrapyjobbole (+http://www.yourdomain.com)'

# Obey robots.txt rules
ROBOTSTXT_OBEY = False

ROBOTSTXT_OBEY = False 一定要设置成 False，断点调试才能正常进行。

4、在工程目录下建立main.py文件，稍后将会在这里面进行调试！

from scrapy.cmdline import execute
import sys
import os

# 打断点调试py文件
# sys.path.append('D:PyCharmpy_scrapyjobbole')
sys.path.append(os.path.dirname(os.path.abspath(__file__)))
print(os.path.dirname(os.path.abspath(__file__)))
execute(['scrapy', 'crawl', 'jobbole'])

5、进行断点调试

股海孙悟空

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
PyCharm下进行Scrapy项目的调试

1、首先创建一个Scrapy项目：在命令行输入：scrapy startproject project_nameproject_name为项目名称，比如我的项目名称为py_scrapyjobbole，生成的目录为：2、创建新的Spider在命令行输入：scrapy genspider jobbole(spider名称) blog.jobbole.com(
复制链接

扫一扫

专栏目录