python爬图片示例_python3.5爬虫实例(一)简单图片抓取

为了提高教学的趣味性,先不从基本的正则表达式入手介绍,用到的时候会解释一下。

先直接一个图片抓取的实例(能快速保存页面的所有图片到本地):

读取网页源码和抓取信息用的是urllib库,正则表达式用的是re库(http://blog.csdn.net/twc829/article/details/50377952    这里有正则的详细介绍)。

step1:获取页面数据

def getHtml(url):

page = urllib.request.Request(url=url)

html=urllib.request.urlopen(page).read()

return html

这是最基本的代码,利用request函数可以获取页面的所有信息,但很多网站都会为了防止被爬取数据,会检查你的headers。所以还需要对程序进行伪装一下,加上自定义的headers:

headers = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0'}

并将page改成page = urllib.request.Request(url=url, headers=headers)

网站中通常含有中文,还要将编译方式改成utf-8:

html = html.decode('utf-8')

综合一下获取页面数据:

def getHtml(url):

headers = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0'}

page = urllib.request.Request(url=url, headers=headers)

html=urllib.request.urlopen(page).read()

html = html.decode('utf-8')

return html

step2:寻找图片先用正则表达式确定页面数据中需要的部分:  reg = r'src="(.*\.jpg)"'      . 是匹配任意字符,换行符\n除外      * 是匹配前一个字符0次或n次,即可以含有n个 .        \.是为了区分 .  表示一个真正的符号.      所以这条语句实在确定搜索目标是XXXX.jpg

然后把正则表达式编译成一个正则表达式对象:

imgre = re.compile(reg)

再读取html 中包含 imgre(正则表达式)的数据:

imglist = re.findall(imgre,html)

step3:保存图片

由于图片比较多,肯定要用循环来进行保存

x = 0

for imgurl in imglist:

urllib.request.urlretrieve(imgurl,'/Users/yangyanxin/Desktop/1/%s.jpg' % x)

x+=1

urlretrieve函数可以将指定url的文件保存到本地

综合一下寻找和保存图片:

def getImg(html):

reg = r'src="(.*\.jpg)"'

imgre = re.compile(reg)

imglist = re.findall(imgre,html)

x = 0

for imgurl in imglist:

urllib.request.urlretrieve(imgurl,'/Users/yangyanxin/Desktop/1/%s.jpg' % x)

x+=1

return imglist

step4:指定网站进行爬取:html=getHtml("http://www.douyu.com")

getImg(html)

运行后,斗鱼首页的所有图片就都在指定文件夹里了

167085f23ec1

综合所有代码:

#-*- coding: UTF-8 -*-

import urllib

import re

from  urllib import request

def getHtml(url):

headers = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0'}

page = urllib.request.Request(url=url, headers=headers)

html=urllib.request.urlopen(page).read()

html = html.decode('utf-8')

return html

def getImg(html):

reg = r'src="(.*\.jpg)"'

imgre = re.compile(reg)

imglist = re.findall(imgre,html)

x = 0

for imgurl in imglist:

urllib.request.urlretrieve(imgurl,'/Users/yangyanxin/Desktop/1/%s.jpg' % x)

x+=1

return imglist

html=getHtml("http://www.douyu.com")

print (getImg(html))

  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值