预备阅读:Python中Requests库的用法 Python中Beautiful Soup的用法
前言
最近学习了北京理工大学崇天老师的Python爬虫课程,老师讲了一个实现“中国大学排名定向爬虫”的实例,这里想自己实现一下,并分享给大家。
2016年中国最好大学排名:http://www.zuihaodaxue.cn/zuihaodaxuepaiming2016.html
功能描述
输入:大学排名URL链接
输出:大学排名信息的屏幕输出(排名,大学名称,总分)
技术路线:requests‐bs4
定向爬虫:仅对输入URL进行爬取,不扩展爬取
定向爬虫的可行性
对于定向爬虫,我们不能暴力爬取数据,而是要遵循网站的robots协议,一般robots协议都在网站根目录下,直接输入类似http://www.zuihaodaxue.cn/robots.txt的URL链接地址即可查看,robots协议告诉我们,哪些内容是可以抓取的,哪些内容是不可以抓取的,这也是为了维护网络的安全环境。
程序的结构设计
步骤1:从网络上获取大学排名网页内容 getHTMLText()
步骤2:提取网页内容中信息到合适的数据结构 fillUnivList()
步骤3:利用数据结构展示并输出结果 printUnivList()
首先我们看一下main()函数,这里的main函数和C语言中的类似,我们定义了一个