采集“中国新闻网”的“即时新闻”数据-Scrapy的使用

实验题目:

采集“中国新闻网”的“即时新闻”数据。网址:滚动新闻-中国新闻网-梳理天下新闻

要求:

使用Scrapy框架采集数据;

采集1-3页的新闻标题、发布时间、新闻内容;

每个新闻用一个文本文件存储,文件名为新闻标题。

实验相关知识的简述

(1)安装Scrapy :Conda install scrapy

(2)熟练使用scrapy

(3)熟练使用xpath以及css定位元素

问题分析与重点环节设计

采集过程主要使用“By.XPATH”以及CSS选择器的方式搜索相应的元素。数据采集过程分为两步,首先采集新闻网列表页中所有新闻超链接的链接地址,然后对于每一个链接地址,采集新闻标题,时间以及内容。

实验目的

(1)掌握Scrapy的安装、引入与项目创建、运行方法

(2)掌握Scrapy选择器的使用

(3)掌握Scrapy的Spider、Item和Pipeline的编程方法

代码:

import scrapy
from ..items import News
class S1Spider(scrapy.Spider):
    name = 's1'
    allowed_domains = ['www.chinanews.com']
    start_urls = ['https://www.chinanews.com/scroll-news/news1.html','https://www.chinanews.com.cn/scroll-news/news2.html','https://www.chinanews.com.cn/scroll-news/news3.html']
        def parse(self, response):
         for link in response.xpath ('//div[@class="w1280 mt20"]//div[@class="content_list"]/ul/li'):
            #title=content.xpath('./div[2]/a/text()').get()
            href=link.xpath('./div[2]/a/@href').get()
            #print('https://www.chinanews.com'+ str(href))
            #classify = content.xpath('./div[1]/a/text()').get()
           # time=content.xpath('./div[@class="dd_time"]/text()').get()
            #print(classify,title,href,time)
            yield scrapy.Request('https://www.chinanews.com'+ str(href),callback= self.parse_news)
    def parse_news(self, response):
         title=response.xpath ('//div[@class="content"]//div[@class="content_maincontent_more"]/h1/text()').get()
         time=response.xpath ('//div[@class="content"]//div[@class="content_maincontent_more"]//div[@class="content_left_time"]/text()').get()
         content='<br>'.join(response.css('.left_zw ::text').getall())
         #print(title,time,content)
         yield News (title =title ,content =content ,time=time )

运行结果:

  • 5
    点赞
  • 7
    收藏
    觉得还不错? 一键收藏
  • 1
    评论
经导师精心指导并认可、获 98 分的毕业设计项目!【项目资源】:微信小程序。【项目说明】:聚焦计算机相关专业毕设及实战操练,可作课程设计与期末大作业,含全部源码,能直用于毕设,经严格调试,运行有保障!【项目服务】:有任何使用上的问题,欢迎随时与博主沟通,博主会及时解答。 经导师精心指导并认可、获 98 分的毕业设计项目!【项目资源】:微信小程序。【项目说明】:聚焦计算机相关专业毕设及实战操练,可作课程设计与期末大作业,含全部源码,能直用于毕设,经严格调试,运行有保障!【项目服务】:有任何使用上的问题,欢迎随时与博主沟通,博主会及时解答。 经导师精心指导并认可、获 98 分的毕业设计项目!【项目资源】:微信小程序。【项目说明】:聚焦计算机相关专业毕设及实战操练,可作课程设计与期末大作业,含全部源码,能直用于毕设,经严格调试,运行有保障!【项目服务】:有任何使用上的问题,欢迎随时与博主沟通,博主会及时解答。 经导师精心指导并认可、获 98 分的毕业设计项目!【项目资源】:微信小程序。【项目说明】:聚焦计算机相关专业毕设及实战操练,可作课程设计与期末大作业,含全部源码,能直用于毕设,经严格调试,运行有保障!【项目服务】:有任何使用上的问题,欢迎随时与博主沟通,博主会及时解答。
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值