python java 爬数据_如何用java爬虫爬取网页上的数据

最新推荐文章于 2024-06-28 14:26:11 发布

了不起的实习生

最新推荐文章于 2024-06-28 14:26:11 发布

阅读量348

点赞数

文章标签： python java 爬数据

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_28687415/article/details/114257591

版权

当我们使用浏览器处理网页的时候，有时候是不需要浏览的，例如使用PhantomJS适用于无头浏览器，进行爬取网页数据操作。最近在进行java爬虫学习的小伙伴们有没有想过如何爬取js生成的网络页面吗？别急，本文小编将向大家介绍。

1、PhantomJS的功能

提供一个浏览器环境的命令行接口，除了不能浏览，其他与正常浏览器一样。它的内核是WebKit引擎，不提供图形界面，只能在命令行下使用。

2、PhantomJS用途

适用范围就是无头浏览器的适用范围。通常无头浏览器可以用于页面自动化和网络爬虫等。

页面自动化测试：希望自动的登陆网站并做一些操作然后检查结果是否正常。

网络爬虫：获取页面中使用js来下载和渲染信息，或者是获取链接处使用js来跳转后的真实地址。

3、对于使用PhantomJS编写的parser.js文件调用java爬虫爬取网页数据Runtime rt = Runtime.getRuntime();

Process process = null;

try {

process = rt.exec("C:/phantomjs.exe C:/parser.js " +url);

InputStream in = process.getInputStream();

InputStreamReader reader = new InputStreamReader(in, "UTF-8");

BufferedReader br = new BufferedReader(reader);

StringBuffer sbf = new StringBuffer();

String tmp = "";

while ((tmp = br.readLine()) != null) {

sbf.append(tmp);

}

return sbf.toString();

} catch (IOException e) {

e.printStackTrace();

}

return null;

以上就是对PhantomJS简单介绍，以及使用java爬虫爬取PhantomJS编写的网络页面进行爬虫数据的代码实现，希望能对你有所帮助哦~更多java推荐：java教程。

了不起的实习生

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。