【数据采集】使用scrapy采集天气网、豆瓣数据信息_基于scrpy爬虫的天气数据采集(1)

2401_84140653

于 2024-05-12 21:51:59 发布

阅读量489

点赞数 5

分类专栏：程序员文章标签： python 学习面试

本文链接：https://blog.csdn.net/2401_84140653/article/details/138769041

版权

程序员专栏收录该内容

132 篇文章 0 订阅

订阅专栏

现在能在网上找到很多很多的学习资源，有免费的也有收费的，当我拿到1套比较全的学习资源之前，我并没着急去看第1节，我而是去审视这套资源是否值得学习，有时候也会去问一些学长的意见，如果可以之后，我会对这套学习资源做1个学习计划，我的学习计划主要包括规划图和学习进度表。

分享给大家这份我薅到的免费视频资料，质量还不错，大家可以跟着学习

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化学习资料的朋友，可以戳这里获取

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！

- 3.1 题目
  - 3.2 思路
  - - 3.2.1 setting.py
福利

实验 1

1.1 题目

指定一个网站，爬取这个网站中的所有的所有图片，例如中国气象网（http://www.weather.com.cn），分别使用单线程和多线程的方式爬取。(限定爬取图片数量为学号后3位)

输出信息: 将下载的Url信息在控制台输出，并将下载的图片存储在images子文件中，并给出截图。

1.2 思路

1.2.1 发送请求

构造请求头

import requests,re
import urllib

headers = {
    'Connection': 'keep-alive',
    'Cache-Control': 'max-age=0',
    'Upgrade-Insecure-Requests': '1',
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/94.0.4606.61 Safari/537.36',
    'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,image/avif,image/webp,image/apng,\*/\*;q=0.8,application/signed-exchange;v=b3;q=0.9',
    'Accept-Language': 'zh-CN,zh;q=0.9',
}

url = "http://www.weather.com.cn/"
request = urllib.request.Request(url, headers=headers)

发送请求

request = urllib.request.Request(url, headers=headers)
r = urllib.request.urlopen(request)

1.2.2 解析网页

页面解析，并且替换回车，方便后续进行正则匹配图片。

html = r.read().decode().replace('\n','')

1.2.3 获取结点

使用正则匹配，先获取所有的a标签，然后爬取a标签下面的所有图片

urlList = re.findall('<a href="(.\*?)" ',html,re.S)

获取所有的图片

allImageList = []
for k in urlList:
    try:
        request = urllib.request.Request(k, headers=headers)
        r = urllib.request.urlopen(request)
        html = r.read().decode().replace('\n','')
        imgList = re.findall(r'<img.\*?src="(.\*?)"', html, re.S)
        allImageList+=imgList
    except Exception as e:
        pass

这里的请求其实也是要用多线程爬取的，所有后续会补上！

1.2.4 数据保存 (单线程)

for i, img in enumerate(allImageList[:102]):
    print(f"正在保存第{i + 1}张图片 路径:{img}")
    resp = requests.get(img)
    with open(f'./image/{img.split("/")[-1]}', 'wb') as f:  # 保存到这个image路径下
        f.write(resp.content)

1.2.4 数据保存 (多线程)

引入多进程模块

import threading
# 多线程
def download\_imgs(imgList,limit):
    threads = []
    T = [
        threading.Thread(target = download, args=(url,i))
        for i, url in enumerate(imgList[:limit + 1])
    ]
    for t in T:
        t.start()
        threads.append(t)
    return threads

编写下载函数

def download(img_url,name):
    resp = requests.get(img_url)
    try:
        resp = requests.get(img_url)
        with open(f'./images/{name}.jpg', 'wb') as f:
                f.write(resp.content)
    except Exception as e:
        print(f"下载失败: {name} {img\_url} -> {e}")
    else:
        print(f"下载完成: {name} {img\_url}")

就很随机

实验 2

2.1 题目

使用scrapy框架复现作业①

2.2 思路

2.2.1 setting.py

解除限制

ROBOTSTXT_OBEY = False

设置保存图片的路径

IMAGES_STORE = r'.\images'  # 保存文件的路径

打开pipelines

ITEM_PIPELINES = {    
'weatherSpider.pipelines.WeatherspiderPipeline': 300,
}

设置请求头

DEFAULT_REQUEST_HEADERS = {    
'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,\*/\*;q=0.8',    
'Accept-Language': 'en',    
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/79.0.3945.16 Safari/537.36',
}

2.2.2 item.py

设置要爬取的字段

class WeatherspiderItem(scrapy.Item):    
number = scrapy.Field()    
pic_url = scrapy.Field()

2.2.3 wt_Spider.py

发送请求

    def start\_requests(self):        
      yield scrapy.Request(self.start_url, callback=self.parse)

获取页面所有的a标签

    def parse(self, response):
        html = response.text
        urlList = re.findall('<a href="(.\*?)" ', html, re.S)
        for url in urlList:
            self.url = url
            try:
                yield scrapy.Request(self.url, callback=self.picParse)
            except Exception as e:
                print("err:", e)
                pass

再次请求所有的a标签下面的网址，再找所有的图片返回

    def picParse(self, response):
        imgList = re.findall(r'<img.\*?src="(.\*?)"', response.text, re.S)
        for k in imgList:
            if self.total > 102:
                return 
            try:
                item = WeatherspiderItem()
                item['pic\_url'] = k
                item['number'] = self.total
                self.total += 1
                yield item
            except Exception as e:
                pass

那么与存入数据库类似，数据处理全部都应该在pipelines.py中处理，也就是说，pipelines还是要发送请求

2.2.4 pipelines.py

导入setting信息

from weatherSpider.settings import IMAGES_STORE as images_store      # 读取配置文件的信息
from scrapy.pipelines.images import ImagesPipeline
settings = get_project_settings()

编写保存函数

    def get\_media\_requests(self, item, info):
        image_url = item["pic\_url"]
        yield Request(image_url)

这里优化的话，应该保存文件的时候重命名会好一点！

实验 3

3.1 题目

爬取豆瓣电影数据使用scrapy和xpath，并将内容存储到数据库，同时将图片存储在 imgs路径下。

3.2 思路

3.2.1 setting.py

解除限制

ROBOTSTXT_OBEY = False

数据库配置

HOSTNAME = '127.0.0.1'
PORT = 3306
DATABASE = 'scrapy\_douban'
USERNAME = 'root'
PASSWORD = 'root'

请求头

DEFAULT_REQUEST_HEADERS = {    
'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,\*/\*;q=0.8',    
'Accept-Language': 'en',    
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/79.0.3945.16 Safari/537.36',}

开启pipelines

ITEM_PIPELINES = {


学好 Python 不论是就业还是做副业赚钱都不错，但要学会 Python 还是要有一个学习规划。最后大家分享一份全套的 Python 学习资料，给那些想学习 Python 的小伙伴们一点帮助！



### 一、Python所有方向的学习路线



Python所有方向路线就是把Python常用的技术点做整理，形成各个领域的知识点汇总，它的用处就在于，你可以按照上面的知识点去找对应的学习资源，保证自己学得较为全面。



![](https://img-blog.csdnimg.cn/img_convert/9f49b566129f47b8a67243c1008edf79.png)



### 二、学习软件

工欲善其事必先利其器。学习Python常用的开发软件都在这里了，给大家节省了很多时间。



![](https://img-blog.csdnimg.cn/img_convert/8c4513c1a906b72cbf93031e6781512b.png)



### 三、全套PDF电子书



书籍的好处就在于权威和体系健全，刚开始学习的时候你可以只看视频或者听某个人讲课，但等你学完之后，你觉得你掌握了，这时候建议还是得去看一下书籍，看权威技术书籍也是每个程序员必经之路。

![](https://img-blog.csdnimg.cn/img_convert/46506ae54be168b93cf63939786134ca.png)



### 四、入门学习视频

我们在看视频学习的时候，不能光动眼动脑不动手，比较科学的学习方法是在理解之后运用它们，这时候练手项目就很适合了。



![](https://img-blog.csdnimg.cn/afc935d834c5452090670f48eda180e0.png?x-oss-process=image/watermark,type_d3F5LXplbmhlaQ,shadow_50,text_Q1NETiBA56iL5bqP5aqb56eD56eD,size_20,color_FFFFFF,t_70,g_se,x_16#pic_center)



### 五、实战案例



光学理论是没用的，要学会跟着一起敲，要动手实操，才能将自己的所学运用到实际当中去，这时候可以搞点实战案例来学习。



![](https://img-blog.csdnimg.cn/img_convert/252731a671c1fb70aad5355a2c5eeff0.png)



### 六、面试资料

我们学习Python必然是为了找到高薪的工作，下面这些面试题是来自阿里、腾讯、字节等一线互联网大厂最新的面试资料，并且有阿里大佬给出了权威的解答，刷完这一套面试资料相信大家都能找到满意的工作。



![](https://img-blog.csdnimg.cn/img_convert/6c361282296f86381401c05e862fe4e9.png)  

![](https://img-blog.csdnimg.cn/img_convert/d2d978bb523c810abca3abe69e09bc1a.png)




**网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。**

**[需要这份系统化学习资料的朋友，可以戳这里获取](https://bbs.csdn.net/forums/4304bb5a486d4c3ab8389e65ecb71ac0)**

**一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！**