如何用python批量下载数据,python批量下载图片教程

大家好,小编来为大家解答以下问题,python爬虫批量下载pdf文件,如何用python批量下载数据,今天让我们一起来看看吧!

#废话不多,直接上手

# -*- coding: utf-8 -*-
import urllib.request  # url request
import re  # regular expression
import os  # dirs
import time

'''
url 下载网址
pattern 正则化的匹配关键词
Directory 下载目录
'''


def BatchDownload(url, pattern, Directory):
    # 拉动请求,模拟成浏览器去访问网站->跳过反爬虫机制
    headers = {'User-Agent':
               'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/64.0.3282.186 Safari/537.36'}
    opener = urllib.request.build_opener()
    opener.addheaders = [headers]

    # 获取网页内容
    content = opener.open(url).read().decode('Utf-8')

    # 构造正则表达式,从content中匹配关键词pattern
    raw_hrefs = re.findall(pattern, content, 0)

    # set函数消除重复元素
    hset = set(raw_hrefs)

    # 下载链接
    for href in hset:
        # 之所以if else 是为了区别只有一个链接的特别情况
        if (len(hset) > 1):
            link = url + href[0]
            filename = os.path.join(Directory, href[0])
            print("正在下载", filename)
            urllib.request.urlretrieve(link, filename)
            print("成功下载!")
        else:
            link = url + href
            filename = os.path.join(Directory, href)
            print("正在下载", filename)
            urllib.request.urlretrieve(link, filename)
            print("成功下载!")

        # 无sleep间隔,网站认定这种行为是攻击,反反爬虫
        time.sleep(1)



备注

Python正则表达式:

. 匹配任意1个字符(除了\n)

[ ] 匹配[ ]中列举的字符

\d 匹配数字,即0-9

\D 匹配非数字,即不是数字

\s 匹配空白,即 空格,tab键

\S 匹配非空白

\w 匹配非特殊字符,即a-z、A-Z、0-9、_、汉字

\W 匹配特殊字符,即非字母、非数字、非汉字、非_

如不懂的,评论区留言~

实用的化给个赞和关注吧!

  • 7
    点赞
  • 9
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
要使用Python批量下载FVC(Fingerprint Verification Competition,指指纹识别比赛)的glasss数据,可以按照以下步骤进行: 1. 首先,需要导入相关的Python库,例如requests和os。 2. 确定要下载数据集所在的URL地址。可以在FVC的官方网站上找到glasss数据集的下载链接。 3. 使用Python的requests库发起HTTP请求,获取目标URL地址上的数据。 4. 将下载数据写入到本地文件中。可以使用Python的os库来创建并命名文件。 5. 重复以上步骤,直到所有的数据都被下载完毕。 下面是一个示例代码: ```python import requests import os # 目标数据集的URL地址 url = "你的数据集URL地址" # 下载数据的保存目录 save_dir = "./fvc_glasss_data/" # 确保保存目录存在 if not os.path.exists(save_dir): os.makedirs(save_dir) # 发起HTTP请求,获取数据 response = requests.get(url) # 确定数据的总大小 total_size = int(response.headers.get('Content-Length', 0)) block_size = 1024 print("开始下载数据...") # 通过迭代写入文件,实现分块下载 with open(os.path.join(save_dir, "fvc_glasss_data.zip"), 'wb') as file: for data in response.iter_content(block_size): file.write(data) # 显示下载进度 downloaded_size = len(data) percent = (downloaded_size / total_size) * 100 print("已下载:{:.2f}%".format(percent), end='\r') print("数据下载完成!") ``` 以上代码演示了如何使用Python的requests库下载FVC的glasss数据集。在代码中,我们首先指定要下载数据集的URL地址和保存路径,使用requests库发起HTTP请求,获取数据,并将其分块写入本地文件中。最后,我们通过循环迭代下载并显示下载进度,直到所有数据都被下载完毕。 请注意,代码中的URL地址和保存路径需要根据实际情况进行修改。另外,可能还需要对下载数据进行解压缩等操作,这部分可以根据具体需求进行修改和补充。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值