爬取高校专业信息的Python爬虫简介与实践

FLK_9090

已于 2024-04-04 00:33:16 修改

阅读量1k

点赞数 19

分类专栏：爬虫文章标签： python 爬虫开发语言

于 2024-04-04 00:31:50 首次发布

本文链接：https://blog.csdn.net/FLK_9090/article/details/137361122

版权

爬虫专栏收录该内容

18 篇文章

订阅专栏

1. 介绍

在当前高校专业信息繁多的情况下，选择适合自己的专业成为了许多学生面临的挑战。为了帮助学生更好地了解各高校专业情况，我们开发了一个Python爬虫程序，用于爬取高校专业信息并保存到Excel文件中。本文将详细介绍该爬虫的实现过程以及如何使用它获取所需信息。

2. 实现过程

2.1. 导入必要模块

import os
import time
from bs4 import BeautifulSoup
import re
import bag
import random
from tqdm import tqdm

2.2. 主要函数 `major_spider()`

def major_spider():
    url = r'https://college.gaokao.com/spelist/p{}/'
    name = re.compile(r'<strong.*?href="(.*?)".*?>(.*?)</a></strong>')
    li = re.compile(r'<li>.*?：(.*?)</li>')
    result = []
    for num in tqdm(range(82)):
        resp = session.get(url.format(num+1))
        time.sleep(random.randint(0, 2))
        resp.encoding = 'gb2312'
        resp.close()
        html = BeautifulSoup(resp.text, 'html.parser')
        soup = html.findAll('div', class_='scores_List')
        for i in BeautifulSoup(str(soup), 'html.parser').findAll('dl'):
            url_name = re.findall(name, str(i))
            ls_tags = re.findall(li, str(i))
            result.append([
                url_name[0][1], ls_tags[0], ls_tags[1], ls_tags[2], ls_tags[3], ls_tags[4], ls_tags[5], url_name[0][0]
            ])
    bag.Bag.save_excel(result, './高校专业.xlsx')