R语言爬虫之rvest包

R语言利用rvest包爬虫,主要用到函数:read_html()、html_nodes()、html_text()和html_attrs()。

安装这个包:install.packages('rvest')

  • read_html():下载网页;

  • html_nodes():获得指定名称的网页元素、节点;

  • html_text():获得指定名称的网页元素、节点里面的文本;

  • html_attrs():获得指定的网址;

以新浪内地新闻为例

下面是新浪内地新闻网址:http://news.sina.com.cn/china/

我们想要爬取每条新闻的标题、时间和对应的链接,因为点击标题,会触发链接,进入每条新闻内容页。

0?wx_fmt=png载入rvest包这一页网址为:下载这一页全部网页元素鼠标右键==》"审查元素",可以看到这些信息所位于的网页标签,如下:0?wx_fmt=png定位到链接<a>标签

 获得链接文本(也就是新闻标题)0?wx_fmt=png获得新闻时间为了便于对照查看,图再放一次:0?wx_fmt=png0?wx_fmt=png

获得链接0?wx_fmt=png0?wx_fmt=png保存为csv文件0?wx_fmt=png

最终所有程序代码如下:

0?wx_fmt=png

点击阅读原文有惊喜!

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

大数据技术派

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值