数据的下载页面地址:https://dumps.wikimedia.org/other/pagecounts-raw
- 今天要下载的数据集就是维基百科的统计数据,如下图,有多个文件下载的连接,每个文件代表一个小时内所有wiki页面被点击的次数,红框中的文件名分为三部分,"20160801"代表统计的年月日,"030000"代表统计的是凌晨3点整到3点59分之间的页面访问情况:
- 这个网站有2007年到2016年之间的统计数据,如下图,下载地址是:https://dumps.wikimedia.org/other/pagecounts-raw
使用迅雷的批量下载功能
这么多数据一个一个下载会很麻烦,可以通过迅雷的批量下载功能来减少工作量;
- 如下图,在一个下载文件上点击鼠标右键,选择"复制链接地址",即可取到此文件的下载地址:
-
上述文件的下载地址为"https://dumps.wikimedia.org/other/pagecounts-raw/2016/2016-08/pagecounts-20160801-000000.gz",根据这个我们能推测出20160801这一天其他23个小时的统计文件的地址,只要把"00000"改成"01000"、"02000",找到了规律就可以用迅雷来做批量下载了;
-
打开迅雷软件,如下图操作,点击红框1中的加号,在弹出的窗口点击红框2中的"添加批量任务":
- 如下图,在弹出的窗口中,将前面的url粘贴进去,然后将红框1中的两个"0"改成"(*)",再把红框2中的数字改为23,然后点击下面的"确定"按钮:
- 如下图,在弹出的窗口中,勾选红框中的"合并为任务组",然后点击下面的"立即下载"按钮,即可开始下载:
- 这样就把2016年8月1日的所有统计数据下载下来了,其他日期的数据也可以用此方法批量下载;
数据格式简介
- 经过漫长等待终于将数据下载下来了,打开看看里面内容,如下所示:
aa.b User_talk:Sevela.p 1 5786
aa.b Wikidata 1 4654
aa.b Wikiquote 1 4658
aa.b Wikiversity 1 4655
aa.d Main_Page 1 5449
aa.d Special:Log/Rschen7754 1 5589
aa.d Special:WhatLinksHere/User:Rschen7754 1 5168
aa.d User:14.99.4.25 1 4761
aa.d User:88.5.75.89 1 4760
aa.d User:95.27.0.82 1 4762
- 以第一行aa.b User_talk:Sevela.p 1 5786为例,这一行由空格字符分割成了四个字段:
| 内容 | 意义 |
| — | — |
| aa.b | 项目名称,".b"表示wikibooks |
自我介绍一下,小编13年上海交大毕业,曾经在小公司待过,也去过华为、OPPO等大厂,18年进入阿里一直到现在。
深知大多数大数据工程师,想要提升技能,往往是自己摸索成长或者是报班学习,但对于培训机构动则几千的学费,着实压力不小。自己不成体系的自学效果低效又漫长,而且极易碰到天花板技术停滞不前!
因此收集整理了一份《2024年大数据全套学习资料》,初衷也很简单,就是希望能够帮助到想自学提升又不知道该从何学起的朋友。
既有适合小白学习的零基础资料,也有适合3年以上经验的小伙伴深入学习提升的进阶课程,基本涵盖了95%以上大数据开发知识点,真正体系化!
由于文件比较大,这里只是将部分目录大纲截图出来,每个节点里面都包含大厂面经、学习笔记、源码讲义、实战项目、讲解视频,并且后续会持续更新
如果你觉得这些内容对你有帮助,可以添加VX:vip204888 (备注大数据获取)
项目、讲解视频,并且后续会持续更新**
如果你觉得这些内容对你有帮助,可以添加VX:vip204888 (备注大数据获取)
[外链图片转存中…(img-NysqXXNL-1712896473715)]