Python爬取新浪足球数据(以中超为例)

最近在整理上学期学位课中用到的一些知识点,其中看到了一个很省代码量的操作,记录一下。上学期多元统计,留了一个课程论文是用相关统计方法来分析数据,像我这种叫天天不应叫地地不灵要啥啥没有“三无蓝孩“,硬着头皮学了爬虫,后来,就有了今天的故事。

入坑一时爽,一直入坑一直爽啊

当然,说是要结合自己的专业,我,一个学GIS的,有些数据怕是要保密的,而且公开我也不会用啊

在这里插入图片描述

但是我爱看球啊,从中超英超德甲西甲,平时闲着没事也爱看看数据啥的,哪个球员又牛逼了,哪个队进欧冠了啥的,然后我就用这些数据做了个聚类(怕是多元统计里最简单的一个了,也感谢老师的浓浓师生情,让我复习了一天的多元统计过了)在这里插入图片描述

回到正题,其实获取数据是主要的工作量,不想让中间商赚差价就只能自己动手丰衣足食了。

首先,打开网址,http://match.sports.sina.com.cn/football/csl/opta_rank.php?item=order&year=2019&lid=8&type=2&dpc=1

在这里插入图片描述
在这里插入图片描述
我起初的思路很钢铁直,就是用XPath获取,结合源码写了如下获取方式

def parse_page(text):
    tree = etree.HTML(text)
    # print(tree)
    ranking = []
    club_name = []
    try_goal = []    
    for i in range(2, 18):
        # 球队排名
        ranking_item = tree.xpath(
            '//tr[' + format(i) + ']/td[1]/text()')[0].strip()
        # 球队名称
        club_name_item = tree.xpath(
            '//tr['+format(i)+']/td/a/text()')[0].strip()
        # 射门数
        try_goal_item = tree.xpath(
            '//tr['+format(i)+']/td[3]/text()')[0].strip()
        ranking.append(ranking_item)
        club_name.append(club_name_item)
        try_goal.append(try_goal_item)
    return zip(ranking, club_name, try_goal)

这样倒是也可以获取数据了,可是,对于Python这种语言这也未免太多代码了吧。。。

再看一眼网页源码,在这里插入图片描述

table,emmm,用pandas啊

然后就用pandas库来实现

da = pandas.read_html(response.content)[0]

写个循环将不同年份的各种类型数据爬下来。。

在这里插入图片描述
哎,今年的中超啥时候能开呢
在这里插入图片描述

  • 2
    点赞
  • 9
    收藏
    觉得还不错? 一键收藏
  • 1
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值