爬取2018年最好大学网上排名前20的学校

最新推荐文章于 2021-01-15 18:21:18 发布

qibao_buxiangtu

最新推荐文章于 2021-01-15 18:21:18 发布

阅读量183

点赞数

文章标签： python

原文链接：https://blog.csdn.net/qq_41589031/article/details/81067699?depth_1-utm_source=distribute.pc_relevant.none-task-blog-OPENSEARCH-15&utm_source=distribute.pc_relevant.none-task-blog-OPENSEARCH-15

版权

要求

爬取2018年最好大学网上排名前20的学校，以表格形式输出，包括（排名，学校名称，总分）

代码

根据基本要求可以编写出初始代码A

#CrawUnivRankingA.py
import requests
from bs4 import BeautifulSoup
import bs4
def getHTMLText(url):
    try:
        r=requests.get(url,timeout=30)
        r.raise_for_status()
        r.encoding=r.apparent_encoding
        return r.text
    except:
        return""

def fillUnivList(ulist,html):
    soup=BeautifulSoup(html,"html.parser")
    for tr in soup.find('tbody').children:
        if isinstance(tr,bs4.element.Tag):
            tds=tr('td')
            ulist.append([tds[0].string,tds[1].string,tds[3].string])

def printUnivList(ulist,num):
    print("{:^10}\t{:^6}\t{:^10}".format("排名","学校名称","总分"))
    for i in range(num):
        u=ulist[i]
        print("{:^10}\t{:^6}\t{:^10}".format(u[0],u[1],u[2]))

def main():
    uinfo=[]
    url='http://www.zuihaodaxue.cn/zuihaodaxuepaiming2018.html'
    html=getHTMLText(url)
    fillUnivList(uinfo,html)
    printUnivList(uinfo,20) #排名前二十
main()
 
 
 
 1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33

但是输出效果如下：
这里写图片描述
学校名称居中对齐并未对齐，是因为自动填充的是英文的空格，要想使得中文获得居中应填充中文的空格，所以进行代码优化，得到代码B：

#CrawUnivRankingA.py
import requests
from bs4 import BeautifulSoup
import bs4
def getHTMLText(url):
    try:
        r=requests.get(url,timeout=30)
        r.raise_for_status()
        r.encoding=r.apparent_encoding
        return r.text
    except:
        return""

def fillUnivList(ulist,html):
    soup=BeautifulSoup(html,"html.parser")
    for tr in soup.find('tbody').children:
        if isinstance(tr,bs4.element.Tag):
            tds=tr('td')
            ulist.append([tds[0].string,tds[1].string,tds[3].string])

def printUnivList(ulist,num):
    tplt="{0:^10}\t{1:{3}^10}\t{2:^10}"
    print(tplt.format("排名","学校名称","总分",chr(12288)))
    for i in range(num):
        u=ulist[i]
        print(tplt.format(u[0],u[1],u[2],chr(12288)))

def main():
    uinfo=[]
    url='http://www.zuihaodaxue.cn/zuihaodaxuepaiming2018.html'
    html=getHTMLText(url)
    fillUnivList(uinfo,html)
    printUnivList(uinfo,20) #排名前二十
main()

 
 
 
 1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35

主要优化部分为：

def printUnivList(ulist,num):
    tplt="{0:^10}\t{1:{3}^10}\t{2:^10}"
    print(tplt.format("排名","学校名称","总分",chr(12288)))
    for i in range(num):
        u=ulist[i]
        print(tplt.format(u[0],u[1],u[2],chr(12288)))
 
 
 
 1
2
3
4
5
6

利用chr(12288)进行优化，以后很多项目中对中文居中对齐格式优化都会运用它
优化后输出：
这里写图片描述

qibao_buxiangtu

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
爬取2018年最好大学网上排名前20的学校

要求爬取2018年最好大学网上排名前20的学校，以表格形式输出，包括（排名，学校名称，总分）代码根据基本要求可以编写出初始代码A#CrawUnivRankingA.pyimport requestsfrom bs4 import BeautifulSoupimport bs4def getHTMLText(url): try: r=requests....
复制链接

扫一扫