python爬取不同url_爬虫|以豆瓣为例简单地介绍爬取网站数据的方法

本文介绍了通过自学大数据知识,如何利用Python爬虫爬取豆瓣网站数据。首先查看豆瓣的robots.txt文件,理解其规则,然后构建用户代理,遵循协议进行编程爬取。通过示例展示爬取过程,强调只需修改URL和相应设置,即可适应不同网站的数据爬取。
摘要由CSDN通过智能技术生成

从上周起就开始自学大数据相关知识,有人说“要教学生一碗水,自己得有一桶水”,所以教师的知识储备需要跟上时代的脚步不断更新。

首先,我打开豆瓣网找到了它的robots.txt文件,打开内容如下:

https://www.douban.com/robots.txt

8d4fa17d4381137028b1ee0f7da32a67.png

然后根据它的协议构建头文件, user–agent是用户代理的意思,说明什么浏览器或哪些爬虫可以访问本网站,使用*表示任意的访问,Disallow对应的为不允许收录网站的某些目录。然后就可以根据robots.txt文件中允许爬取的方式开始编程爬取数据:

import requests
url ="https://movie.douban.com/chart"try: hd ={ 'User-agent':'*'} r = requests.get(url, headers=hd) r.raise_for_status() r.encoding=r.apparent_encodingprint(r.text)except:print("爬取失败")

运行后,数据果然被爬取下来了,如下图,是不是很简单?

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值