Gecco学习笔记（四）

最新推荐文章于 2024-02-25 12:15:55 发布

软工7班姜彪

最新推荐文章于 2024-02-25 12:15:55 发布

阅读量147

点赞数

文章标签： java 爬虫

本文链接：https://blog.csdn.net/j000818/article/details/121441427

版权

本文是关于Gecco学习的笔记，通过编写DEMO演示如何使用Gecco爬虫抓取特定网站的新闻标题和发布时间。通过类似Jquery的选择器选取HTML节点，借助注解实现URL匹配，代码简洁易读。内容包括添加Maven依赖、构建列表页面抓取及详情页面抓取逻辑，并展示了主函数的启动过程。

摘要由CSDN通过智能技术生成

2021SC@SDUSC

最近分析Gecco的爬虫代码，决定写个DEMO测试一下，也方便更好的分析其源代码，抓取网站
http://zj.zjol.com.cn/home.html，主要抓取新闻的标题和发布时间做为抓取测试对象。抓取HTML节点通过像Jquery选择器一样选择节点，非常方便，Gecco代码主要利用注解实现来实现URL匹配，看起来比较简洁美观。

添加Maven依赖

<dependency>
   <groupId>com.geccocrawler</groupId>
   <artifactId>gecco</artifactId>
   <version>1.0.8</version>
</dependency>

编写抓取列表页面

@Gecco(matchUrl = "http://zj.zjol.com.cn/home.html?pageIndex={pageIndex}&pageSize={pageSize}",pipelines = "zJNewsListPipelines")
public class ZJNewsGeccoList implements HtmlBean {
  @Request
  private HttpRequest request;
  @RequestParameter
  private int pageIndex;
  @RequestParameter
  private int pageSize;
  @HtmlField(cssPath =