python用户输入字符串、统计输入的正确率_python 爬虫基本使用——统计杭电oj题目正确率并排序...

最新推荐文章于 2022-12-15 14:08:24 发布

han Lee

最新推荐文章于 2022-12-15 14:08:24 发布

阅读量521

点赞数

文章标签： python用户输入字符串、统计输入的正确率

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_42360846/article/details/112050453

版权

本文介绍了使用Python的Urllib和BeautifulSoup4库爬取杭电在线评测系统（OJ）的题目信息，统计每道题目的正确率，并进行排序。通过遍历网页、解析HTML，将数据存储到字典中，然后按正确率排序并保存到txt文件。爬虫主要涉及Urllib的request模块和BeautifulSoup4的解析功能。

摘要由CSDN通过智能技术生成

python爬虫主要用两个库：Urllib和BeautifulSoup4。一个用来爬取网页，一个用来解析网页。

Urllib是Python内置的HTTP请求库，它包含四个模块：

1、request，最基本的 HTTP 请求模块，用来模拟发送请求，就像在浏览器里输入网址然后敲击回车一样，只需要给库方法传入 URL 与额外的参数，就可以模拟这个过程。

2、error ，异常处理模块，如果出现请求错误，我们可以捕获这些异常，然后进行重试或其他操作保证程序不会意外终止。

3、parse ，工具模块，提供了许多 URL 处理方法，比如拆分、解析、合并等。

4、robotparser，主要用于识别网站的 robots.txt 文件，判断网站是否可以爬取，用的较少。

这里只用到了最常用的request。

BeautifulSoup4从bs4包中导出，这里主要用的就是它的解析功能。

代码如下，注释写得很清楚了：

#杭电OJ题目AC率排序

import urllib.request as ur

from bs4 import BeautifulSoup

dic = {} #存："题号：题名 AC 提交次数正确率"

for t in range(1,59,1):#1~58页都爬一遍

print(t)

url = 'http://acm.hdu.edu.cn/listproblem.php?vol='+str(t) #存网址

bs = BeautifulSoup(ur.urlopen(url).read(),"html.parser")#获取网址的html并转换为可以python可以使用的结构

ql0 = str(bs.body.table.contents[11].td.table.contents[1])#网页的DOM解析后可以直接通过"."来寻找子元素，找到题目的列表元素后，将列表中所有题目转换成字符串。(可以输出看看)

ql = ql0[30:-10].split(";") #字符串中的题目以";"分隔，将它们分开，并存到列表中

for i in ql: #以下就是格式化处理每个题目，然后存到字典中

info1 = i.split(',"',1)

num = info1[0].split(',')[1]

info2 = info1[1].split('",',1)

name = info2[0]

right,submit = info2[1].split(',',1)

submit = submit[:-1]

dic[num] = [name,int(right),int(submit),int(right)/int(submit)]

dic = sorted(dic.items(),key = lambda x: x[1][3]) #每页题目都存入字典后，把字典中的题目通过正确率进行排序，传出列表

with open('Statistics.txt','w',encoding = 'utf-8') as f:#把统计排序好的题目保存到txt中

for i in dic:

f.write(str(i)+'\n')

print("Success！")

以上就是python 爬虫基本使用——统计杭电oj题目正确率并排序的详细内容，更多关于python 爬虫的资料请关注python博客其它相关文章！

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。