1cascading是什么
cascading是一个架构在Hadoop上的API,用来创建复杂和容错数据处理工作流。它抽象了集群拓扑结构和配置来快速开发复杂分布式的应用,而不用考虑背后的MapReduce。Cascading目前依赖于 Hadoop提供存储和执行架构,但是Cascading API为开发者隔离了Hadoop的技术细节,提供了不需要改变初始流程工作流定义就可以在不同的计算框架内运行的能力。
2为什么要用cascading
cascading使组织能够快速开发复杂的数据处理与Hadoop的应用。cascading使用场景通常有:
1增长的数据量日益增加的计算的线性增长使无法使用单独的计算单元计算,因此需要以hadoop为技术手段的分布式计算。
2 复杂的计算过程,