1.pandas
2.Apache Parquet
Apache Parquet是Hadoop生态圈中一种新型列式存储格式,它可以兼容Hadoop生态圈中大多数计算框架(Hadoop、Spark等),被多种查询引擎支持(Hive、Impala、Drill等),并且它是语言和平台无关的。
3.Apache Arrow
Apache Arrow 是一种基于内存的列式数据结构,正像上面这张图的箭头,它的出现就是为了解决系统到系统之间的数据传输问题
4.dask
Dask是一款用于分析计算的灵活并行计算库。
Dask由两部分组成:针对计算优化的动态任务调度。这与Airflow,Luigi,Celery或Make类似,但针对交互式计算工作负载进行了优化。
“大数据”集合, 像并行数组,数据框和列表一样,它们将通用接口(如NumPy,Pandas或Python迭代器)扩展到大于内存或分布式环境。 这些并行集合运行在动态任务调度器之上。
5.Celery
Celery是一个简单、灵活且可靠的,处理大量消息的分布式系统,专注于实时处理的异步任务队列,同时也支持任务调度。
6.Matplotlib
Matplotlib是一个Python的2D绘图库,它以各种硬拷贝格式和跨平台的交互式环境生成出版质量级别的图形。
7.RabbitMQ
8.Presto
Presto是一个分布式SQL查询引擎,用于查询分布在一个或多个不同数据源中的大数据集。
9.Airflow
Airflow是一个以编程方式创作,安排和监控工作流程的平台
大数据相关组件
最新推荐文章于 2024-05-07 13:03:57 发布