正常发货正版包邮java从入门到软件
68.9元
包邮
(需用券)
去购买 >
项目背景
小说网站优书网(http://yousuu.com/bookstore/)提供的小说查询功能不是很强大,很多高级查询功能都没有,比如想要查询出评分在8.0以上并且标签包含‘仙侠’、字数超过100万字的小说列表,查询结果按评分倒序排序。为了解决这个痛点,我们把所有小说数据(包含小说名称、评分、简介、作者等信息)爬到本地来,然后导入elasticsearch中,最后就可以构建出任何我们想要的查询了。
项目实战
实现分析
观察上面两张截图,可以看到列表页除了简介信息,其他信息都有;所以我们的实现思路就是从列表页提取出小说名称、作者、字数、评分、状态、标签等信息,从详情页提取出简介信息。
代码实现
通过文章《webmagic核心设计和运行机制分析》,我们已经知道在使用WebMagic框架时,因为每个页面的不同,所以必须要我们自己定制处理逻辑的组件是PageProcessor(解析html,提取目标数据)和Pipeline(持久化目标数据)。
1. Spider:程序入口,爬虫启动类
@Component
public class YousuuTask {
private static final String SITE_CODE = "yousuu";
private static final String URL = "http://www.yousuu.com/bookstore/?type&tag&countWord&status&update&sort&page=";
public void doTask() {
MySpider mySpider = MySpider.create(new YousuuProcessor());
mySpider.setDownloader(new MyDownloader(SITE_CODE));
mySpider.setScheduler(new RedisScheduler(SITE_CODE));
mySpider.addPipeline(new YousuuPipeline());
mySpider.thread(10);
int totalPage = 8187;
// 添加起始url
for(int i=1; i<=totalPage; i++) {
Request request = new Request(URL + i);
// 在Request额外信息中设置页面类型
request.putExtra(YousuuProcessor.TYPE, YousuuProcessor.LIST_TYPE);
mySpider.addRequest(request);
}