python数据etl,GitHub - ferventdesert/etlpy: a smart stream-like crawler & etl python library

etlpy

##designed by desert

a smart stream-like crawler & etl python library

##1.简介

etlpy是基于配置文件的数据采集和清洗工具。

写爬虫和数据清洗代码总是很烦人。因此,应该通过工具生成爬虫和数据清洗的代码! etlpy就是为了解决这个问题而生的。

通过可视化和图形化设计工具,快速生成爬虫和数据清洗流程,并保存为xml文件,并由etlpy引擎解析它,即可获得最终的数据结果。

##2.使用

使用起来非常简单:

from etl import ETLTool

tool = ETLTool();

tool.LoadProject('project.xml', '数据清洗ETL-大众点评');

datas = tool.RefreshDatas();

for r in datas:

print(r)

RefreshDatas函数返回的是生成器,通过for循环,即可自动读取所有数据。

##3.基本原理

模块分为 生成,过滤,排序,转换,执行四种。

利用Python的生成器,可以将不同模块组织起来,定义一个流水线,数据(python的字典)会在流水线上被加工和消费。

图形化工具是用C#开发的,使用了类似Python生成器的Linq技术。其原始思路来自于Lisp的s-表达式。

##4. 用途

爬虫,计算,清洗,任何符合一定计算范式的数据,都可以使用它来完成。

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值