上次面试,面试官问了下如何使用websocket抓取js渲染了的页面,因为原来抓取小说网站上的首页面都是静态网页,还没考虑过js渲染页面,后来看了看,发现使用websocket抓取js渲染页面主要有两种方式:
1.使用工具,将页面进行js渲染之后再抓取,这主要的工具有Selenium
、HtmlUnit
或者PhantomJs,但是这些工具都存在一定的效率问题,同时也不是那么稳定。好处是编写规则同静态页面一样。
2.分析ajax请求中的地址,因为js渲染出的数据一般也是通过ajax从后台传输过来的,而且相对于页面样式,这种接口变化可能性更小。缺点就是找到这个请求,并进行模拟,是一个相对困难的过程,也需要相对多的分析经验。
两种模式的大概模型:
-
后端渲染的页面
下载辅助页面=>发现链接=>下载并分析目标HTML
-
前端渲染的页面
发现辅助数据=>构造链接=>下载并分析目标AJAX
参考地址:http://webmagic.io/docs/zh/posts/chx-cases/js-render-page.html