python中url什么意思_python爬虫中的url下载器是什么?怎么用？

最新推荐文章于 2024-02-19 22:56:04 发布

weixin_39631649

最新推荐文章于 2024-02-19 22:56:04 发布

阅读量578

点赞数

文章标签： python中url什么意思

接上一篇我们提到url下载器，那么前期的入库筛选工作已经由url管理器完成了，整理的工作自然要由url下载器接手。当我们需要爬取的数据已经去重后，下载器的主要任务的是这些数据下载下来。所以它的使用也并不复杂，不过需要借助到我们之前所学过的一个库进行操作，相信之前的基础大家都学的很牢固。下面小编就来为大家介绍url下载器及其使用的方法。

下载器的作用就是接受URL管理器传递给它的一个url，然后把该网页的内容下载下来。python自带有urllib和urllib2等库(这两个库在python3中合并为urllib)，它们的作用就是获取指定的网页内容。不过，在这里我们要使用一个更加简洁好用而且功能更加强大的模块：Requests。

Requests并非python自带模块，需要安装。关于其具体使用方法请查看以往文章，在此不多做介绍。

下载器接受一个url作为参数，返回值为下载到的网页内容(格式为str)。下面就是一个简单的下载器，其中只有一个简单的函数download()：'''

-----------------------------------------------------------------

HtmlDownloader

'''

class HtmlDownloader(object):

def download(self, url):

print "start download"

if url is None:

return None

print "url is None"

user_agent = 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.108 Safari/537.36'

headers = {'User-Agent':user_agent}

print "start requests"

r = requests.get(url, headers=headers)

#判断响应状态

if r.status_code == 200:

r.encoding = 'utf-8'

print "该页面下载成功！{}".format(url)

return r.text

else:

print "该页面下载失败！{}".format(url)

return None

在requests请求中设置User-Agent的目的是伪装成浏览器，这是一只优秀的爬虫应该有的觉悟。

有些小伙伴已经猜出来了，requests库和我们的爬取数据密不可分，搭配着url下载器我们就可以成功抓取想要的数据了，没学会的小伙伴可以进入我们之前文章回顾一下~更多Python学习指路:PyThon学习网教学中心。

weixin_39631649

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
python中url什么意思_python爬虫中的url下载器是什么?怎么用？

接上一篇我们提到url下载器，那么前期的入库筛选工作已经由url管理器完成了，整理的工作自然要由url下载器接手。当我们需要爬取的数据已经去重后，下载器的主要任务的是这些数据下载下来。所以它的使用也并不复杂，不过需要借助到我们之前所学过的一个库进行操作，相信之前的基础大家都学的很牢固。下面小编就来为大家介绍url下载器及其使用的方法。下载器的作用就是接受URL管理器传递给它的一个url，然后把该网...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。