#!/usr/bin/python
# -*- coding: utf-8 -*-
###############################################################
# 功能:下载图片url以”//“开头并且是https协议
###############################################################
# 爬虫通用流程:
# [1]发送请求
# [2]解析页面
# [3]提取数据
# [4]下载内容
# [5]存储内容
# 引包
import time
import requests
from PIL import Image # 图片处理包
from io import BytesIO # 数据输入输出包
# list类型:图片url以 https开头的测试数据
data = ['//cbu01.alicdn.com/img/ibank/2019/681/430/11507034186_664650735.230x230.jpg', '//cbu01.alicdn.com/img/ibank/2020/186/096/17407690681_664650735.230x230.jpg', '//cbu01.alicdn.com/img/ibank/O1CN01DsOO732LcbfiefI60_!!1046989713-0-cib.230x230.jpg']
def image_downloader(data):
for index, imageUrl in enumerate(data):
if data:
print("【开始下载图片】\n>>>list数据类型,取出引索对应的图片url")
print("引索值:"+str(index), "---对应值url:"+imageUrl)
turl = "https:" + str(imageUrl) # 获取可访问实际的图片src,可浏览器直接访问
print("下载图片的src", turl) # 输出:下载图片的src: /_nuxt/img/180.bbab67e.jpg
# 请求服务器
html = requests.get(turl)
print(html) # 输出 <Response [200]>
# 定义下载下来图片的名字和格式
img_name = str(index + 1) + '.png' # index 是整数需要专场str
print("图片名字是:", img_name)
# 引入图片流,写入图片数据
image = Image.open(BytesIO(html.content)) # 引包from PIL import Image , from io import BytesIO
print("写入图片信息:",
image) # 输出:<PIL.JpegImagePlugin.JpegImageFile image mode=RGB size=1440x720 at 0x24EDB19B0C8>
# 保存图片到指定目录
data_folder_path = str('./photos') # 必要要有此目录,不然无法下载,没有自动/手动创建
image.save(data_folder_path + "/" + img_name)
print('第%d张图片下载完成!' % (index + 1))
# time sleep() 函数推迟调用线程的运行,可通过参数secs指秒数,表示进程挂起的时间,实际越短,下载越快
time.sleep(0.1) # 引包import time 自定义延时
image_downloader(data)
完整代码
# [1]发送请求
import requests
from lxml import html
from PIL import Image # 图片处理包
from io import BytesIO # 数据输入输出包
import os
import time
import datetime
data_folder_path = str('./data1688') # 定义图片保存目录
# [1]发送数据
#url = "https://www.yestone.com" # #固定输入网站URL
url = "https://bsgou.1688.com/page/offerlist.htm?spm=a2615.7691456.autotrace-paginator.2.c6b2ee8bcgRuAu&tradenumFilter=false&sampleFilter=false&sellerRecommendFilter=false&videoFilter=false&mixFilter=false&privateFilter=false&mobileOfferFilter=%24mobileOfferFilter&groupFilter=false&sortType=tradenumdown&pageNum=2#search-bar"
page = requests.Session().get(url)
print(page)
# [2]解析页面
tree = html.fromstring(page.text)
print(tree)
# [3]提取数据
# 获取商品图片名
# data = tree.xpath('')
data = tree.xpath('//ul[@class="offer-list-row"]//div[@class="image"]//img/@data-lazy-load-src') # 获取需要的数据
print(type(data))
print(data)
# 文件名包含时间处理
def file_time():
file_time = str(datetime.datetime.now())
file_time = file_time.replace("-", "")
file_time = file_time.replace(":", "")
file_time = file_time.replace(" ", "")
# print(file_time[:14])
return file_time
# 遍历列表类型
# >>>seq = ['one', 'two', 'three']
# >>> for i, element in enumerate(seq):
# ... print i, element
# ...
# 0 one
# 1 two
# 2 three
for index, imageUrl in enumerate(data):
if data:
print(index, imageUrl)
turl = "https:"+str(imageUrl) # 获取可访问实际的图片src,可浏览器直接访问
print("下载图片的src", turl) # 输出:下载图片的src: /_nuxt/img/180.bbab67e.jpg
# 请求服务器
html = requests.get(turl)
print(html) # 输出 <Response [200]>
# 定义下载下来图片的名字和格式
img_name = str(index + 1) + file_time() + '.jpg' # index 是整数需要专场str
print("图片名字是:", img_name)
# 引入图片流,写入图片数据
image = Image.open(BytesIO(html.content))
print("写入图片信息:", image) # 输出:<PIL.JpegImagePlugin.JpegImageFile image mode=RGB size=1440x720 at 0x24EDB19B0C8>
# 保存图片到指定目录
#data_folder_path = str('./data1688')
image.save(data_folder_path + "/" + img_name)
print('第%d张图片下载完成' % (index + 1))
# time sleep() 函数推迟调用线程的运行,可通过参数secs指秒数,表示进程挂起的时间,实际越短,下载越快
time.sleep(0.1) # 自定义延时
# # 遍历列表类型
# if data:
# for i in data:
# print("data:", i)
# print("下载图片的src:","https:"+str(i)) # 输出:下载图片的src: /_nuxt/img/180.bbab67e.jpg
# turl="https:"+str(i)