图片下载方法

#!/usr/bin/python
# -*- coding: utf-8 -*-
###############################################################
# 功能:下载图片url以”//“开头并且是https协议
###############################################################

# 爬虫通用流程:
# [1]发送请求
# [2]解析页面
# [3]提取数据
# [4]下载内容
# [5]存储内容
# 引包
import time
import requests
from PIL import Image  # 图片处理包
from io import BytesIO  # 数据输入输出包


# list类型:图片url以 https开头的测试数据
data = ['//cbu01.alicdn.com/img/ibank/2019/681/430/11507034186_664650735.230x230.jpg', '//cbu01.alicdn.com/img/ibank/2020/186/096/17407690681_664650735.230x230.jpg', '//cbu01.alicdn.com/img/ibank/O1CN01DsOO732LcbfiefI60_!!1046989713-0-cib.230x230.jpg']


def image_downloader(data):
    for index, imageUrl in enumerate(data):
        if data:
            print("【开始下载图片】\n>>>list数据类型,取出引索对应的图片url")
            print("引索值:"+str(index), "---对应值url:"+imageUrl)
            turl = "https:" + str(imageUrl)  # 获取可访问实际的图片src,可浏览器直接访问
            print("下载图片的src", turl)  # 输出:下载图片的src: /_nuxt/img/180.bbab67e.jpg
            # 请求服务器
            html = requests.get(turl)
            print(html)  # 输出 <Response [200]>
            # 定义下载下来图片的名字和格式
            img_name = str(index + 1) + '.png'  # index 是整数需要专场str
            print("图片名字是:", img_name)
            # 引入图片流,写入图片数据
            image = Image.open(BytesIO(html.content))  # 引包from PIL import Image , from io import BytesIO
            print("写入图片信息:",
                  image)  # 输出:<PIL.JpegImagePlugin.JpegImageFile image mode=RGB size=1440x720 at 0x24EDB19B0C8>
            # 保存图片到指定目录
            data_folder_path = str('./photos')  # 必要要有此目录,不然无法下载,没有自动/手动创建
            image.save(data_folder_path + "/" + img_name)
            print('第%d张图片下载完成!' % (index + 1))
            # time sleep() 函数推迟调用线程的运行,可通过参数secs指秒数,表示进程挂起的时间,实际越短,下载越快
            time.sleep(0.1)  # 引包import time 自定义延时

image_downloader(data)

完整代码 

# [1]发送请求
import requests
from lxml import html
from PIL import Image  # 图片处理包
from io import BytesIO  # 数据输入输出包
import os
import time
import datetime
data_folder_path = str('./data1688')  # 定义图片保存目录
# [1]发送数据
#url = "https://www.yestone.com" # #固定输入网站URL
url = "https://bsgou.1688.com/page/offerlist.htm?spm=a2615.7691456.autotrace-paginator.2.c6b2ee8bcgRuAu&tradenumFilter=false&sampleFilter=false&sellerRecommendFilter=false&videoFilter=false&mixFilter=false&privateFilter=false&mobileOfferFilter=%24mobileOfferFilter&groupFilter=false&sortType=tradenumdown&pageNum=2#search-bar"
page = requests.Session().get(url)
print(page)

# [2]解析页面
tree = html.fromstring(page.text)
print(tree)

# [3]提取数据
# 获取商品图片名
# data = tree.xpath('')
data = tree.xpath('//ul[@class="offer-list-row"]//div[@class="image"]//img/@data-lazy-load-src')  # 获取需要的数据
print(type(data))
print(data)

# 文件名包含时间处理
def file_time():
    file_time = str(datetime.datetime.now())
    file_time = file_time.replace("-", "")
    file_time = file_time.replace(":", "")
    file_time = file_time.replace(" ", "")
    # print(file_time[:14])
    return file_time

# 遍历列表类型
# >>>seq = ['one', 'two', 'three']
# >>> for i, element in enumerate(seq):
# ...     print i, element
# ...
# 0 one
# 1 two
# 2 three

for index, imageUrl in enumerate(data):
     if data:
         print(index,  imageUrl)
         turl = "https:"+str(imageUrl)  # 获取可访问实际的图片src,可浏览器直接访问
         print("下载图片的src", turl)  # 输出:下载图片的src: /_nuxt/img/180.bbab67e.jpg
         # 请求服务器
         html = requests.get(turl)
         print(html)  # 输出 <Response [200]>
         # 定义下载下来图片的名字和格式
         img_name = str(index + 1) + file_time() + '.jpg'  # index 是整数需要专场str
         print("图片名字是:", img_name)
         # 引入图片流,写入图片数据
         image = Image.open(BytesIO(html.content))
         print("写入图片信息:", image)  # 输出:<PIL.JpegImagePlugin.JpegImageFile image mode=RGB size=1440x720 at 0x24EDB19B0C8>
         # 保存图片到指定目录
         #data_folder_path = str('./data1688')
         image.save(data_folder_path + "/" + img_name)
         print('第%d张图片下载完成' % (index + 1))
         # time sleep() 函数推迟调用线程的运行,可通过参数secs指秒数,表示进程挂起的时间,实际越短,下载越快
         time.sleep(0.1)  # 自定义延时




# # 遍历列表类型
# if data:
#    for i in data:
#     print("data:", i)
#     print("下载图片的src:","https:"+str(i))  # 输出:下载图片的src: /_nuxt/img/180.bbab67e.jpg
#     turl="https:"+str(i)

 

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

悟道行僧

鼓励是我最大的动力!

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值