Python瀑布流爬虫-爬取360美女图片+爬取百度美女图片(嘿嘿~)

今天编写脚本的目的是什么?看美女,看美女,看美女(重要的事情说三遍),不过看美女可以缓解疲劳,在这个浮躁的社会里我希望沉淀下自己的灵魂。嘿嘿~                                                                          

                                               

 

Python瀑布流爬虫

1、爬虫认识

2、Python与爬虫

3、关于爬取图片的设想

4、瀑布流爬虫的分析

实战:快速爬取360网站图片

实战:快速爬取百度图片瀑布流爬虫实现,批量下载图片!

1、爬虫认识

爬虫(spider:网络蜘蛛):是一个用脚本代替浏览器请求服务器获取服务器资源的程序。

我们知道什么是爬虫了,无非就是模拟浏览器去请求服务器,那什么是瀑布流爬虫呢?为啥这个名字这么吊?它又有什么前尘往事呢,让我们走进科学~不~走进它深入探究下……

                                                                                                                                                       -----Smile Mr

什么是瀑布流?

我们数据比较多的时候,为了更好用户体验节省服务器资源,我们进行渐进式的加载。

顾名思义,瀑布流肯定数据量很大,然后进行用户体验非常好的渐进式加载,让我们一直下拉就会有不同的数据展示,来来来,让我们通过图来走两步~

                         

没错,同志们,就是这味道,一下拉就会有神奇的事情发生,实在是太棒了~

2、Python与爬虫

上面的种种举例大家都可能在脑海中有一定的印象了,什么是瀑布流,不过,关键的时候还需要实操下,对不,想要看瀑布流网页效果的,请单击:  自行体验下,36D的非一般的感觉。

下面的例子按照:https://image.baidu.com/这个例子来做的,其实效果都是一样滴,不过百度的美女实在太暴力了,鄙人受不鸟,所以用唯美替代了,毕竟生活中我也是一个小清新呢~

                                                                                 

    结构分析

            

 

抓包分析

             

              

访问抓包数据

            

经过上面的紧张略微带刺激的分析,嘿嘿(流鼻血~),我发现,下面几个规律:

1.  图片来源js的渲染

2.  使用的ajax技术

3.  返回json数据

4.  每次下拉都会请求一个url地址

5.  每次请求的url地址具体的参数都有一定的规律

讲到这里老铁们,都差不多了解了,我们只需要拿到具体的 json数据(响应体),然后进行转换提取就欧了~真是so easy~

废话不多说,老规矩,直接上代码, 我们开始尝试编写代码,先介绍下我自己的环境啊哈~

Pycharm 编译器 2018.2.3版本

Python3.7.2 

requests(这是网络请求包,需要下载  :pip install requests)

实战:爬取360图片,将图片保存在本地

import  requests,time
from urllib import request
url = 'http://image.so.com/zj?ch=beauty&sn=30&listtype=new&temp=1'
headers= {
    'Referer': 'http://image.so.com/z?ch=beauty',
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/71.0.3578.80 Safari/537.36'
}
str_data = '''ch: beauty
sn: 120
listtype: new
temp: 1
'''
send_data = {}
for data in str_data.splitlines():

line_data = data.split(': ')

if len(line_data) == 2:
            key,value = line_data
            if key and value:
                 send_data[key] = value
response = requests.get(url,headers=headers,params=send_data)

json_data = response.json()['list']

for index,src in enumerate(json_data):
    image_url = src['qhimg_url']
    try:
        image_name = './image/'+image_url[-8:]
        request.urlretrieve(url=image_url,filename=image_name)

    except Exception as e:
        print(e)
    else:
        print('{} is download'.format(image_name))

运行效果如下:

  

实战:百度图片下载

import time
import requests
from urllib import request
url = 'http://image.baidu.com/search/acjson?tn=resultjson_com&ipn=rj&ct=201326592&is=&fp=result&queryWord=%E5%94%AF%E7%BE%8E&cl=2&lm=-1&ie=utf-8&oe=utf-8&adpicid=&st=&z=&ic=&hd=&latest=&copyright=&word=%E5%94%AF%E7%BE%8E&s=&se=&tab=&width=&height=&face=&istype=&qc=&nc=1&fr=&expermode=&selected_tags=&pn=30&rn=30&gsm=1e&1545019467831='
headers = {
'Referer': 'http://image.baidu.com/search/index?tn=baiduimage&ps=1&ct=201326592&lm=-1&cl=2&nc=1&ie=utf-8&word=%E5%94%AF%E7%BE%8E',
"User-Agent": "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.77 Safari/537.36",
}

data_str = '''
tn: resultjson_com
ipn: rj
ct: 201326592
is:
fp: result
queryWord: 唯美
cl: 2
lm: -1
ie: utf-8
oe: utf-8
adpicid:
st:
z:
ic:
hd:
latest:
copyright:
word: 唯美
s:
se:
tab:
width:
height:
face:
istype:
qc:
nc: 1
fr:
expermode:
selected_tags:
pn: 30
rn: 60
gsm: 1e
1545019467831:
'''
send_data = {}
for line in data_str.splitlines():
    line_data = line.split(': ')
    if len(line_data) == 2:
        key,value = line_data
        if key and value:
            send_data[key] = value
response = requests.get(url= url,headers = headers,params=send_data)
content = response.json()['data']
print(content)
num = 1

for index,src in enumerate(content):
    img_url = src.get('middleURL')
    if img_url:
        name = './image/iamge_%s_%s.png'%('唯美',index)
        try:
            request.urlretrieve(url = img_url,filename=name)

        except Exception as e:
            print(e)
        else:
            print('%s is down'%name)
        time.sleep(2)

 接下来我们进行简单的封装:

from urllib import request
import requests,os,time
def get_image(keywords,num):
    url = 'https://image.baidu.com/search/acjson?tn=resultjson_com&ipn=rj&ct=201326592&is=&fp=result&queryWord=%E9%AC%BC%E5%88%80&cl=2&lm=-1&ie=utf-8&oe=utf-8&adpicid=&st=-1&z=&ic=&hd=&latest=&copyright=&word=%E9%AC%BC%E5%88%80&s=&se=&tab=&width=&height=&face=0&istype=2&qc=&nc=1&fr=&expermode=&force=&pn=150&rn=30&gsm=96&1545877953682='

    headers = {
        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/71.0.3578.80 Safari/537.36',
        'Host': 'image.baidu.com',
        'Referer': 'https://image.baidu.com/search/index?tn=baiduimage&ipn=r&ct=201326592&cl=2&lm=-1&st=-1&fm=result&fr=&sf=1&fmq=1545877913556_R&pv=&ic=&nc=1&z=&hd=&latest=&copyright=&se=1&showtab=0&fb=0&width=&height=&face=0&istype=2&ie=utf-8&hs=2&word=%E9%AC%BC%E5%88%80',
    }
    data = '''
    tn: resultjson_com
    ipn: rj
    ct: 201326592
    is:
    fp: result
    queryWord: 鬼刀
    cl: 2
    lm: -1
    ie: utf-8
    oe: utf-8
    adpicid:
    st: -1
    z:
    ic:
    hd:
    latest:
    copyright:
    word: 鬼刀
    s:
    se:
    tab:
    width:
    height:
    face: 0
    istype: 2
    qc:
    nc: 1
    fr:
    expermode:
    force:
    pn: 30
    rn: 30
    gsm: 96
    1545877953682:
    '''
    sendData = {}
    send_data = data.splitlines()
    try:
        for i in send_data:
            data_list = i.split(': ')
            if len(data_list) == 2:
                key,value = data_list
                if key and value:
                    sendData[key] = value
    except Exception as e:
        print(e)
    sendData['word'] = sendData['queryWord'] = keywords
    sendData['rn'] = str(30*num)
    response = requests.get(url=url,headers=headers,params=sendData)
    content = response.json()['data']
    for index,src in enumerate(content):
        # index =str(index).zfill(2)
        image_url = src.get('middleURL')
        if os.path.exists('image')
            pass
        else:
            os.mkdir('image')
        if image_url and os.path.exists('image'):
            name = './image/image_%s_%s.png'%(index,keywords)
            try:
                request.urlretrieve(url=image_url,filename=name)
            except Exception as e:
                print(e)
            else:
                print('%s is download'%name)
                time.sleep(1)
# print(content)
if __name__ == '__main__':
    keywords = input('请输入你要的内容:')
    num = int(input('请输入你想要的数量:'))
    get_image(keywords,num)

运行结果如下:

时间有限,该下班了,我就写到这里,封装的并不是很完美,但是我需要下班,放飞下自我喽~

生命诚可贵,爱情价更高,若为自由故,两个皆可抛

                                                                                                                                           -----Smile Mr

 

 

 

  • 2
    点赞
  • 26
    收藏
    觉得还不错? 一键收藏
  • 8
    评论
后台路径:/admcn 创始人账户密码都是admcn(后台即可修改账户密码,请第一时间修改) 操作运营: 第一天: 1:先登录后台 在基本设置里设置好域名信息(其它基本不用管/如需修改站名、关键词、描述等信息请直接用记事本或其它工具打开程序根目录的index.html文件修改保存即可); 在广告管理中添加您的广告信息(流量未过千不建议添加弹窗/其它广告任意) 2:打开名为“网址”的txt文档,按顺序一个个地到人家的站去申请流量交换,每申请一个就回到你后台点击“交换网站添加” 首次加站不要超过30个网站,因为过多流量分配不过来,保持在30个左右,加站最好在网络高峰期的时候才加。OK后每间隔6-8小时就到后台看看人家的返量情况,要是没有流量给你的就“下架”(放入未审核区/别直接删除),然后继续加新站,保持网站个数30个左右即可。 第二天: 1:通常今天就可以上弹窗了,因为正常的话只需要24小时左右IP就能过千,弹窗数量表太多,也得站在用户的角度思考下,点一次是弹窗、再点一次还是弹窗,你想用户还会继续点吗!用户不点就没法与其它站交换流量,你没量给人家,人家当然也不会给你,最终你的量也会越来越少。 2:IP过千后,你要做的就是“取优去劣”,即陆续的替换反量比例少的交换站。例如流量出路>来路很多的就按倒序一一替换掉(还是放入未审核区/表直接删)。 第三天and以后: 第三天的工作和第二天一样,以后也是如此。不断替换反量少的交换站,尽量做到只保留流量进出比例在1:1以上的交换站,如果30个交换站流量进出比例高于1:1,那么离日IP过万就很近了。 聪明人看到这应该差不多完全明白了。若还不明白再问我 ps:崭新的站,没有一丁点流量的站开始做的时候注意下交换站有无“去量要求”,因为部分交换站会要求先给他们送去10-20个IP,他们才会给你审核、反量。所以新站前期尽量与那些无要求或要求低的交换站做,等流量上去了再与有要求的做即可。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 8
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值