Python进阶实战爬虫：爬取斗图网_python爬取全栈图片网站-CSDN博客

本文链接：https://blog.csdn.net/weixin_45974628/article/details/103647353

本文介绍了如何使用Python进行进阶爬虫实战，通过爬取斗图网的数据，详细讲解了爬取过程，包括摘要的概述和具体的爬取代码实现。

摘要由CSDN通过智能技术生成

一.爬取斗图网

1.摘要

    使用xpath匹配规则查找对应信息文件
    将请求伪装成浏览器
    Referer 防跨域请求

2.爬取代码

#导入模块
import requests

#爬取网址
url = 'http://www.doutula.com/'

#伪装成成浏览器请求
#找到request200,200代表请求成功的里面的内容,按F12里面找
'''
Referer: http://www.doutula.com/  Referer为防跨域请求,我看了下图片都是这个所有也可以不加上去,这个简单来说就是你只能通过这个网址来找到图片,如果他和url不同我们也把他加入再hearders里面,和下面保存一起
User-Agent: Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/74.0.3729.131 Safari/537.36
'''

#编程字典,为了把我们请求伪装成浏览器
hearders = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/74.0.3729.131 Safari/537.36',}

response = requests.get(url,headers=hearders) #hearders是请求头,body是请求主体

#成功拿到响应

#查找的内容
'''
data-original="http://ww4.sinaimg.cn/bmiddle/9150e4e5gy1g48gluqdp6j203c03ct92.jpg" 
'''