Crawler：反爬虫之基于urllib库+伪装浏览器方式实现从各种网站上（以百度贴吧为例）获得你喜欢的照片下载到本地电脑上

最新推荐文章于 2024-03-31 09:54:00 发布

一个处女座的程序猿

最新推荐文章于 2024-03-31 09:54:00 发布

阅读量1w

点赞数 10

分类专栏： Crawler

本文链接：https://blog.csdn.net/qq_41185868/article/details/79587011

版权

Crawler 专栏收录该内容

21 篇文章 3 订阅

订阅专栏

Crawler：反爬虫之基于urllib库+伪装浏览器方式实现从各种网站上（以百度贴吧为例）获得你喜欢的照片下载到本地电脑上

输出结果

实现代码

输出结果

后期更新……

实现代码

import urllib.request<br>import re
import os

def open_url(url):
    req=urllib.request.Request(url)
    req.add_header("User-Agent", "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/56.0.2924.90 Safari/537.36 2345Explorer/9.2.1.17116")
    page=urllib.request.urlopen(req)
    html=page.read().decode("utf-8")
    return html

def get_img(html):
    p=r'<img class="BDE_Image" src="([^"]+\.jpg)"'
    imglist=re.findall(p,html)
    for each in imglist: 
        print(each)

    for each in imglist:
        filename=each.split("/")[-1] 
        urllib.request.urlretrieve(each, filename,None)

if __name__=="__mian__":
    url="http://tieba.baidu.com/p/3563409202" 
    get_img(open_url(url))                    

url="http://tieba.baidu.com/p/3563409202"
get_img(open_url(url))