网页抓取与处理的一些方法

昨天还是2014,今天就变成了2015。时间总是那么快,这篇文章就作为2015年的一个开始吧。

这篇文章主要介绍一些网页抓取及抓取下来的内容处理。

所需要的jar包点击打开链接,我放在百度云盘里。有需要的可以下载,其他的请自行下载。

百度百科对网页抓取的定义当然本文并没有介绍的那么多,只是介绍对单个页面的抓取,和模拟提交表单抓取页面,如需深究,请自行baidu or google。

上面的方法直接返回String字符串,只需传入一个链接即可。相信大家都看的懂。

那么获取到的String字符串,我们该怎么处理呢?

我先拿一个网站测试下。就比如这个点击打开链接,这个网站显示了今天在历史上发生了什么大事件。而我们要抓取的内容只有一部分,比如历史上今天大事记



或者历史上今天逝世


这里就对抓取历史上今天大事记做一个介绍。


这里用到了一个extract的方法,也就是对www.rijiben.com获取的的String字符串进行分割,获取到我们需要的信息。


这里的html也就是上面传进去的html。compile里面是正则表达式,它把整个页面分成了5段,那么我们应该如何获取到里面的那一段呢?


group里面的数字就是获取分割后的哪一段。

具体的可以查看这里

下面介绍如何模拟提交表单后抓取页面,其实原理与上面大同小异。


相信我上面的图片已经很明显的把功能都说明了,后续对表单提交后显示的页面做其他处理就要看你怎么做了大笑

最后祝大家元旦快乐微笑


  • 2
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值