利用python3爬虫下载图片、pdf文档

最新推荐文章于 2024-08-07 03:47:06 发布

玄蛰

最新推荐文章于 2024-08-07 03:47:06 发布

阅读量5.3k

点赞数 4

分类专栏： Python之爬虫 Python python3爬虫 python数据分析

本文链接：https://blog.csdn.net/weifuliu/article/details/84261593

版权

Python 同时被 3 个专栏收录

15 篇文章 0 订阅

订阅专栏

python3爬虫

8 篇文章 8 订阅

订阅专栏

Python之爬虫

7 篇文章 0 订阅

订阅专栏

环境
语言环境：python3.6
操作系统：Win10

第三方库
requests

互联网上的资源大都是以二进制形式存储和运输的，如图片、pdf、音频、视频等，像.dat、.ts等这些不常用的文件也都是二进制。我们知道python3爬虫是利用爬虫模拟浏览器向服务端发送请求，并解析服务器返回来的响应，像上述这些文件都是以二进制形式返回到本地客户端的。而response对象的属性content表示的则是HTTP响应内容的二进制形式，利用该属性，我们可以通过代码对网上资源进行下载
下载这些资源最重要的一点就是，你要知道这些文件在哪儿，也就是他们的URL,即他们的连接

下载图片
链接：美女长发披肩背影美图

美女长发披肩背影

代码实现

import requests  

url = 'https://img-blog.csdnimg.cn/20181119214250858.png'
r = requests.get(url)
img = r.content       #响应的二进制文件
with open('美女.png','wb') as f:     #二进制写入
    f.write(img)

下载pdf
下载链接：http://47.106.94.154/study_file/hdu-multi6-fzdx.pdf

代码实现

import requests

url = 'http://47.106.94.154/study_file/hdu-multi6-fzdx.pdf'
r = requests.get(url)
pdf = r.content       #响应的二进制文件
with open('杭电多校第六场.pdf','wb') as f:     #二进制写入
    f.write(pdf)