Java调用phantomjs采集ajax加载生成的网页

日前有采集需求,当我把所有的对应页面的链接都拿到手,准备开始根据链接去采集(写爬虫爬取)对应的终端页的时候,发觉用程序获取到的数据根本没有对应的内容,可是我的浏览器看到的内容明明是有的,于是浏览器查看源代码也发觉没有,此时想起该网页应该是ajax加载的。不知道ajax的小朋友可以去学下web开发啦。

#

采集ajax生成的内容手段不外乎两种。一种是通过http观察加载页面时候的请求,然后我们模仿该请求去得到对应的内容,第二种则是模仿浏览器行为去渲染这个页面得到内容。我在这里决定采用第二种方式,之前一直玩webkit,不过一直要加载页面太浪费资源了,此时了解到有一个好玩的玩意phantomjs,这是个可以用命令行来操作webkit的玩意,然后也可以直接在里面用js的api去操作页面(当然,我这边比较简单就懒得用了)。

#

下载完phantomjs之后直接解压就可以使用,然后在path目录加入phantomjs的路径(以便直接在命令行就可以执行phantomjs命令)。

#

接下来要完成个代码,一个是用phantomjs去获取页面(采用js编写行为),一个是采用Java去调用phantomjs来达到获取内容的作用,接下来直接贴代码。

[javascript]
//codes.js  
system = require('system')  
address = system.args[1];//获得命令行第二个参数 接下来会用到  
//console.log('Loading a web page');  
var page = require('webpage').create();  
var url = address;  
//console.log(url);  
page.open(url, function (status) {  
    //Page is loaded!  
    if (status !== 'success') {  
        console.log('Unable to post!');  
    } else {  
        //console.log(page.content);  
        //var title = page.evaluate(function() {  
        //  return document.title;//示范下如何使用页面的jsapi去操作页面的  
        //  });  
        //console.log(title);  

        console.log(page.content);  
    }     
    phantom.exit();  
});   

上述的js代码估计应该没几个看不懂的。。。

#

接下来贴java代码!

[java]
import org.apache.commons.io.IOUtils;  

import java.io.*;  

/** 
 * Created with IntelliJ IDEA. 
 * User: lsz 
 * Date: 14-4-22 
 * Time: 下午1:17 
 * utils for http 
 */  
public class HttpUtils {  
    public static String getAjaxCotnent(String url) throws IOException {  
        Runtime rt = Runtime.getRuntime();  
        Process p = rt.exec("phantomjs.exe c:/phantomjs/codes.js "+url);//这里我的codes.js是保存在c盘下面的phantomjs目录  
        InputStream is = p.getInputStream();  
        BufferedReader br = new BufferedReader(new InputStreamReader(is));  
        StringBuffer sbf = new StringBuffer();  
        String tmp = "";  
        while((tmp = br.readLine())!=null){  
            sbf.append(tmp);  
        }  
        //System.out.println(sbf.toString());  
        return sbf.toString();  
    }  

    public static void main(String[] args) throws IOException {  
        getAjaxCotnent("http://www.baidu.com");  
    }  
}  

其实原理很简单,就是通过进程间通信用java调用phantomjs这个组件去请求渲染页面,不过这种做法因为每次都要重新启动phantomjs进程,所以比较慢,还有另外一种直接用phantomjs加载页面后,把内容post给我们自定义的一个http后端接收数据,会更快一点。

  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值