XXL-CRAWLER v1.3.0,分布式爬虫框架

XXL-CRAWLER是一个分布式爬虫框架,新版本v1.3.0调整了开源协议为Apache2.0,升级了依赖,并优化了代码结构。该框架具有简洁的API,支持多线程、异步、IP动态代理、JS渲染等功能,并可通过扩展实现分布式和JS渲染。此外,还包括失败重试、代理IP管理、动态参数调整等多个实用特性。
摘要由CSDN通过智能技术生成

Release Notes

  • 1、开源协议:由 GPLv3 调整为 Apache2.0 开源协议;
  • 2、版本升级:依赖版本升级,如jsoup、htmlunit、selenium等;
  • 3、代码重构:优化代码结构,提升系统可维护性;

简介

XXL-CRAWLER 是一个分布式爬虫框架。一行代码开发一个分布式爬虫,拥有"多线程、异步、IP动态代理、分布式、JS渲染"等特性;

输入图片说明

特性

  • 1、简洁:API直观简洁,可快速上手;
  • 2、轻量级:底层实现仅强依赖jsoup,简洁高效;
  • 3、模块化:模块化的结构设计,可轻松扩展
  • 4、面向对象:支持通过注解,方便的映射页面数据到PageVO对象,底层自动完成PageVO对象的数据抽取和封装返回;单个页面支持抽取一个或多个PageVO
  • 5、多线程:线程池方式运行,提高采集效率;
  • 6、分布式支持:通过扩展 “RunData” 模块,并结合Redis或DB共享运行数据可实现分布式。默认提供LocalRunData单机版爬虫。
  • 7、JS渲染:通过扩展 “PageLoader” 模块,支持采集JS动态渲染数据。原生提供 Jsoup(非JS渲染,速度更
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值