Python 爬取中国研招网招生简章

本文介绍了如何使用Python的requests和BeautifulSoup库爬取中国研招网的研究生招生简章数据,包括GET请求、页面解析、数据结构化和存储至Excel的过程。
摘要由CSDN通过智能技术生成

观察网页

观察网页:通过谷歌浏览器进入中国研招网招生简章界面后,右键点击“检查”,点击“网络”后刷新页面;点击“响应”,如图所示

在”响应“中观察到,我们需要的数据在这里,说明这是一个静态网页。

请求数据

通过查看“标头”中显示网页的请求方式是GET请求。说明可以用requests库请求数据。

引入第三方库

import requests   from bs4 import BeautifulSoup   import pandas as pd   items=[]#定义一个空列表,为后期数据的存储做好准备   

原网页虽有23页,但实际有内容的是前三页,其余都是空白页面,故共计3页的信息。此外,观察不同页码的网址,可以发现规律,第{i}页:https://yz.chsi.com.cn/kyzx/zsjz/?start={i-1}*80 所以我们可以引用For循环语句进行爬取3页内容,设置相关代码如下:

for i in range(1,4):#中国高校招生简章共3页             url='https://yz.chsi.com.cn/kyzx/zsjz/?start={i-1}*80'           r=requests.get(url)           r.encoding=r.apparent_encoding #防止出现乱码           text=r.text   

解析数据

利用BeautifulSoup进行解析数据。通过检查网页元素可以发现,所有院校的招生简章都存储在class="news-list"的"ul"标签下。

故此段代码如下:

soup = BeautifulSoup(text,'html.parser')    li_list=soup.find('ul',class_="news-list").find_all('li')#获取动态   for li in li_list:          title=li.find('a').text#获取学校标题               href=li.find('a').get('href')[1:]             child_url='https://yz.chsi.com.cn/'+href #获取高校招生简章的链接       time=li.find('span').text# 获取公告时间              item=[title,time,child_url]               items.append(item)#将爬取的所有文件添加到item的总列表中   

储存数据

`df=pd.DataFrame(items,columns=['标题','发布时间','网页链接'])    df.to_excel('全国高校研究生招生简章.xlsx')` 

全套代码及结果

import requests   from bs4 import BeautifulSoup   import pandas as pd   items=[]#定义一个空列表   #请求数据    for i in range(1,4):#中国高校招生简章共3页       url='https://yz.chsi.com.cn/kyzx/zsjz/?start={i-1}*80'          r=requests.get(url)           r.encoding=r.apparent_encoding #防止出现乱码         text=r.text   #解析数据       soup = BeautifulSoup(text,'html.parser')       li_list=soup.find('ul',class_="news-list").find_all('li')#获取动态       for li in li_list:           title=li.find('a').text#获取学校标题           href=li.find('a').get('href')[1:]           child_url='https://yz.chsi.com.cn/'+href #获取高校招生简章的链接           time=li.find('span').text# 获取公告时间           item=[title,time,child_url]           items.append(item)#将爬取的所有文件添加到item的总列表中               #保存数据   df=pd.DataFrame(items,columns=['标题','发布时间','网页链接'])   df.to_excel('全国高校研究生招生简章.xlsx')   

以上就是“Python 爬取中国研招网招生简章”的全部内容,希望对你有所帮助。

关于Python技术储备

学好 Python 不论是就业还是做副业赚钱都不错,但要学会 Python 还是要有一个学习规划。最后大家分享一份全套的 Python 学习资料,给那些想学习 Python 的小伙伴们一点帮助!

一、Python所有方向的学习路线

Python所有方向的技术点做的整理,形成各个领域的知识点汇总,它的用处就在于,你可以按照上面的知识点去找对应的学习资源,保证自己学得较为全面。

在这里插入图片描述

二、Python必备开发工具

img

三、Python视频合集

观看零基础学习视频,看视频学习是最快捷也是最有效果的方式,跟着视频中老师的思路,从基础到深入,还是很容易入门的。

img

四、实战案例

光学理论是没用的,要学会跟着一起敲,要动手实操,才能将自己的所学运用到实际当中去,这时候可以搞点实战案例来学习。

img

五、Python练习题

检查学习结果。

img

六、面试资料

我们学习Python必然是为了找到高薪的工作,下面这些面试题是来自阿里、腾讯、字节等一线互联网大厂最新的面试资料,并且有阿里大佬给出了权威的解答,刷完这一套面试资料相信大家都能找到满意的工作。

img

最后祝大家天天进步!!

上面这份完整版的Python全套学习资料已经上传至CSDN官方,朋友如果需要可以直接微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】。

  • 5
    点赞
  • 10
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值