常看网页表单数据_如何用R语言爬取网页表格数据节省一天工作时间

今天R语言给我帮了一个大忙,简单的几行代码几乎节省了我一天的时间,小白表示R语言太有用了!

问题如下:

我想获取网页中表格里的数据,网页表格如下图

但是呢,很坑爹的是,这个表格不能复制粘贴,Ctrl+C,Ctrl+V后出来的只是网址,估计是被禁用了复制粘贴功能。而如果一个一个敲的话工作量会很大,估计最后眼都要瞎了……

有2014-2017年四年,每年有7个项目,每个项目分成12个月,共计336个表,有的表内容还特别多,数字特别大,如下所示:

照这个工作量,一个数一个数敲到Excel中的话,一天不吃不喝估计都搞不定。

幸好,我最近刚入门了R……

听说R语言也有爬取数据的功能,于是在网上简单的搜了一些帖子后,利用了XML包,成功的将这网页中的336个表存成了Excel格式。

代码如下:

>install.packages(“XML”)#安装XML包

>library(XML) #载入XML包

>tbls

>pop

>write.csv(pop,file="d:/pop.csv") #存储pop为CSV文档至D盘中

这样,就快速实现了网页中的数据爬取。第一次将R语言运用到工作中去,灰常有成就感~但是毕竟有336个网页,最后要运行336次代码,工作量也是有的。各位童鞋如果有更好的方法可以更快速的导出数据的欢迎提供~

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值