图片下载方法

最新推荐文章于 2023-04-16 18:50:15 发布

悟道行僧

最新推荐文章于 2023-04-16 18:50:15 发布

阅读量2.6k

点赞数

本文链接：https://blog.csdn.net/logan2015/article/details/118067661

版权

python 专栏收录该内容

11 篇文章 1 订阅

订阅专栏

#!/usr/bin/python
# -*- coding: utf-8 -*-
###############################################################
# 功能：下载图片url以”//“开头并且是https协议
###############################################################

# 爬虫通用流程：
# [1]发送请求
# [2]解析页面
# [3]提取数据
# [4]下载内容
# [5]存储内容
# 引包
import time
import requests
from PIL import Image  # 图片处理包
from io import BytesIO  # 数据输入输出包


# list类型：图片url以 https开头的测试数据
data = ['//cbu01.alicdn.com/img/ibank/2019/681/430/11507034186_664650735.230x230.jpg', '//cbu01.alicdn.com/img/ibank/2020/186/096/17407690681_664650735.230x230.jpg', '//cbu01.alicdn.com/img/ibank/O1CN01DsOO732LcbfiefI60_!!1046989713-0-cib.230x230.jpg']


def image_downloader(data):
    for index, imageUrl in enumerate(data):
        if data:
            print("【开始下载图片】\n>>>list数据类型，取出引索对应的图片url")
            print("引索值:"+str(index), "---对应值url："+imageUrl)
            turl = "https:" + str(imageUrl)  # 获取可访问实际的图片src，可浏览器直接访问
            print("下载图片的src", turl)  # 输出：下载图片的src: /_nuxt/img/180.bbab67e.jpg
            # 请求服务器
            html = requests.get(turl)
            print(html)  # 输出 <Response [200]>
            # 定义下载下来图片的名字和格式
            img_name = str(index + 1) + '.png'  # index 是整数需要专场str
            print("图片名字是:", img_name)
            # 引入图片流，写入图片数据
            image = Image.open(BytesIO(html.content))  # 引包from PIL import Image ， from io import BytesIO
            print("写入图片信息:",
                  image)  # 输出：<PIL.JpegImagePlugin.JpegImageFile image mode=RGB size=1440x720 at 0x24EDB19B0C8>
            # 保存图片到指定目录
            data_folder_path = str('./photos')  # 必要要有此目录，不然无法下载，没有自动/手动创建
            image.save(data_folder_path + "/" + img_name)
            print('第%d张图片下载完成！' % (index + 1))
            # time sleep() 函数推迟调用线程的运行，可通过参数secs指秒数，表示进程挂起的时间，实际越短，下载越快
            time.sleep(0.1)  # 引包import time 自定义延时

image_downloader(data)

完整代码

# [1]发送请求
import requests
from lxml import html
from PIL import Image  # 图片处理包
from io import BytesIO  # 数据输入输出包
import os
import time
import datetime
data_folder_path = str('./data1688')  # 定义图片保存目录
# [1]发送数据
#url = "https://www.yestone.com" # #固定输入网站URL
url = "https://bsgou.1688.com/page/offerlist.htm?spm=a2615.7691456.autotrace-paginator.2.c6b2ee8bcgRuAu&tradenumFilter=false&sampleFilter=false&sellerRecommendFilter=false&videoFilter=false&mixFilter=false&privateFilter=false&mobileOfferFilter=%24mobileOfferFilter&groupFilter=false&sortType=tradenumdown&pageNum=2#search-bar"
page = requests.Session().get(url)
print(page)

# [2]解析页面
tree = html.fromstring(page.text)
print(tree)

# [3]提取数据
# 获取商品图片名
# data = tree.xpath('')
data = tree.xpath('//ul[@class="offer-list-row"]//div[@class="image"]//img/@data-lazy-load-src')  # 获取需要的数据
print(type(data))
print(data)

# 文件名包含时间处理
def file_time():
    file_time = str(datetime.datetime.now())
    file_time = file_time.replace("-", "")
    file_time = file_time.replace(":", "")
    file_time = file_time.replace(" ", "")
    # print(file_time[:14])
    return file_time

# 遍历列表类型
# >>>seq = ['one', 'two', 'three']
# >>> for i, element in enumerate(seq):
# ...     print i, element
# ...
# 0 one
# 1 two
# 2 three

for index, imageUrl in enumerate(data):
     if data:
         print(index,  imageUrl)
         turl = "https:"+str(imageUrl)  # 获取可访问实际的图片src，可浏览器直接访问
         print("下载图片的src", turl)  # 输出：下载图片的src: /_nuxt/img/180.bbab67e.jpg
         # 请求服务器
         html = requests.get(turl)
         print(html)  # 输出 <Response [200]>
         # 定义下载下来图片的名字和格式
         img_name = str(index + 1) + file_time() + '.jpg'  # index 是整数需要专场str
         print("图片名字是:", img_name)
         # 引入图片流，写入图片数据
         image = Image.open(BytesIO(html.content))
         print("写入图片信息:", image)  # 输出：<PIL.JpegImagePlugin.JpegImageFile image mode=RGB size=1440x720 at 0x24EDB19B0C8>
         # 保存图片到指定目录
         #data_folder_path = str('./data1688')
         image.save(data_folder_path + "/" + img_name)
         print('第%d张图片下载完成' % (index + 1))
         # time sleep() 函数推迟调用线程的运行，可通过参数secs指秒数，表示进程挂起的时间，实际越短，下载越快
         time.sleep(0.1)  # 自定义延时




# # 遍历列表类型
# if data:
#    for i in data:
#     print("data：", i)
#     print("下载图片的src:","https:"+str(i))  # 输出：下载图片的src: /_nuxt/img/180.bbab67e.jpg
#     turl="https:"+str(i)

悟道行僧

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
打赏
0
评论
图片下载方法

#!/usr/bin/python# -*- coding: utf-8 -*-################################################################ 功能：下载图片url以”//“开头并且是https协议################################################################ 爬虫通用流程：# [1]发送请求# [2]解析页面# [3]提取数据# [4]下载内容# [5.
复制链接

扫一扫