好久没有写博客了,今天写一个基于nodejs的一个简易的小爬虫,大神勿喷。
要用到的模块:
request 用于发起http请求
cheerio 用于将下载下来的dom进行分析和提取 你可以把它当做jQuery来用
废话太多了,直接附上代码 大家去研究吧
var request = require('request')
var cheerio = require('cheerio')
for(var i = 1;i<4;i++){
request('http://www.souweixin.com/personal?t=41&p='+i,function(error,response,body){
if(!error && response.statusCode == 200){
$ = cheerio.load(body)
var links = [];
$(".boldBorder > a").each(function(i,item){
links.push($(this).attr("href"))
})
for(var i=0;i<links.length;i++){
request('http://www.souweixin.com'+links[i],function(error,response,body){
if(!error && response.statusCode == 200){
$ = cheerio.load(body)
console.log('weixin: '+$('.bold').text()+' name: '+$('h1').text()+' desc: '+$('.f18').text());
}
})
}
}
})
}
其实个人觉得 这个代码只适合新手去研究 大神就略过吧 毕竟我也是一个菜鸟!么么哒!